{"as_of":"2026-08-10T13:32:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:30c6798643e22268fc492c0f6deb399dd85e58ad4bcfba310896b97387b29b71","coverage":[{"denominator":75,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":75,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T11:03:32.220111Z","state":"measured"},{"denominator":78,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":78,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T09:47:59.248127Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T11:46:55.739072Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.23172","snapshot_observed_at":"2026-08-04T09:47:59.248127Z","title":"Benchmarking massively parallelized multi-task reinforcement learning for robotics tasks","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.13704","last_updated":"2026-06-03T03:31:14Z","snapshot_observed_at":"2026-08-04T09:47:43.934006Z","submitted_at":"2025-10-15T16:01:30Z","title":"Simplicial Embeddings Improve Sample Efficiency in Actor-Critic Agents","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-04T09:47:59.248127Z"},"links":{"cited_paper":"/paper/2507.23172","citing_paper":"/paper/2510.13704"},"observation_digest":"sha256:81f0dc4045f12fdd6211434c9b50ac88a79c7dc5c10b33dc902e6207285bbf63","observation_id":"c1747023-19c3-4ee6-a954-0939abf28fc4","resolution":{"observed_at":"2026-08-04T09:47:59.248127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"cited_work":{"arxiv_id":"2507.23172","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.23172","snapshot_observed_at":"2026-07-02T11:46:55.739072Z","title":"arXiv preprint arXiv:2507.23172 , year=","venue":null,"work_id":"09750f57-e3c8-48f3-a103-aecca8d9a5b8","year":null},"citing_paper":{"arxiv_id":"2605.11473","last_updated":"2026-05-12T03:40:28Z","snapshot_observed_at":"2026-08-08T22:43:14.252060Z","submitted_at":"2026-05-12T03:40:28Z","title":"TOPPO: Rethinking PPO for Multi-Task Reinforcement Learning with Critic Balancing","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-13T01:48:13.679862Z"},"links":{"cited_paper":"/paper/2507.23172","citing_paper":"/paper/2605.11473"},"observation_digest":"sha256:15afe8e816de4475203357cc7faa4c9cd4460a519b0519d3b17142714ddbcfc5","observation_id":"a1f022c6-d5d9-416e-9437-40c857ca52a9","resolution":{"observed_at":"2026-05-13T01:52:05.702271Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"cited_work":{"arxiv_id":"2507.23172","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.23172","snapshot_observed_at":"2026-07-02T11:46:55.739072Z","title":"arXiv preprint arXiv:2507.23172 , year=","venue":null,"work_id":"09750f57-e3c8-48f3-a103-aecca8d9a5b8","year":null},"citing_paper":{"arxiv_id":"2606.05555","last_updated":"2026-06-04T01:09:20Z","snapshot_observed_at":"2026-08-07T21:26:35.552849Z","submitted_at":"2026-06-04T01:09:20Z","title":"Representation Learning Enables Scalable Multitask Deep Reinforcement Learning","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-06-28T03:02:59.297911Z"},"links":{"cited_paper":"/paper/2507.23172","citing_paper":"/paper/2606.05555"},"observation_digest":"sha256:e8a66024832d7d012a8721b9d8c4dac4ab6e2c97623a188928993da6fd05056e","observation_id":"320feb81-15bf-4380-b99e-8748e88b3295","resolution":{"observed_at":"2026-07-02T11:46:55.741036Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.23172/citation-record","integrity":"/paper/2507.23172/integrity","json":"/paper/2507.23172/citation-record.json","paper":"/paper/2507.23172"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:03:21.547614Z","title":"Deep reinforcement learning at the edge of the statistical precipice","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:21.547614Z"},"links":{"citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:65bf17999220e54b399da1079c24705be16988a177384d861c759e4cb2b01d14","observation_id":"e0259aa2-b285-4ab6-9435-193e1a95d66b","resolution":{"observed_at":"2026-08-06T11:03:21.547614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:03:38.861446Z","title":"Locomujoco: A comprehensive imitation learning benchmark for locomotion","venue":null,"work_id":"694ef791-bfc6-4ecd-9ca4-2674e349ad0c","year":2023},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:21.603099Z"},"links":{"citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:5171e5a4f637c833c6ad520d2d9f90589dbf6583ae84c23022219e554525e1c0","observation_id":"a5fa4944-397e-44e1-8606-27211b6b0bf6","resolution":{"observed_at":"2026-08-06T11:03:38.932352Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.09779","last_updated":"2022-10-20T20:24:34Z","snapshot_observed_at":"2026-08-08T05:24:51.876369Z","submitted_at":"2021-08-22T16:45:58Z","title":"Transferring Dexterous Manipulation from GPU Simulation to a Remote Real-World TriFinger","version":2},"cited_work":{"arxiv_id":"2108.09779","doi":null,"metadata_source":"pith","pith_arxiv_id":"2108.09779","snapshot_observed_at":"2026-08-06T11:03:33.449776Z","title":"Transferring Dexterous Manipulation from GPU Simulation to a Remote Real-World TriFinger","venue":"cs.RO","work_id":"0ed58163-26a3-42df-a614-2f2589c6423d","year":2021},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:21.702708Z"},"links":{"cited_paper":"/paper/2108.09779","citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:1f57cf2fbdfedc1bed224c4ef72761ccdb5a0162613124e0ea02930cc619d7d2","observation_id":"4bad7e69-22dd-4008-acfc-f4649fc76bef","resolution":{"observed_at":"2026-08-06T11:03:33.564907Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1607.06450","last_updated":"2016-07-21T19:57:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-07-21T19:57:52Z","title":"Layer Normalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1607.06450","snapshot_observed_at":"2026-08-06T11:03:21.846873Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:21.846873Z"},"links":{"cited_paper":"/paper/1607.06450","citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:cbc125b5f3b72feeea72f78203ca0f3256c1c05af8a875c40da2ff9da028f35c","observation_id":"3827d9ad-3158-4b90-8100-960951aa70db","resolution":{"observed_at":"2026-08-06T11:03:21.846873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1611.06256","last_updated":"2017-03-02T19:12:19Z","snapshot_observed_at":"2026-08-10T08:48:37.807337Z","submitted_at":"2016-11-18T21:34:47Z","title":"Reinforcement Learning through Asynchronous Advantage Actor-Critic on a GPU","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1611.06256","snapshot_observed_at":"2026-08-06T11:03:21.926066Z","title":"Reinforcement learning through asynchronous advantage actor-critic on a gpu","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:21.926066Z"},"links":{"cited_paper":"/paper/1611.06256","citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:bbaca260b5ddf747f8d6d2dd49c135c9e7719425cceefabc59bdcb095e1efd78","observation_id":"99b10ff1-ae20-4779-bf81-9719f4b0d411","resolution":{"observed_at":"2026-08-06T11:03:21.926066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09884","last_updated":"2024-03-16T00:02:49Z","snapshot_observed_at":"2026-08-06T08:23:36.728709Z","submitted_at":"2023-06-16T14:52:24Z","title":"Jumanji: a Diverse Suite of Scalable Reinforcement Learning Environments in JAX","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09884","snapshot_observed_at":"2026-08-06T11:03:22.084295Z","title":"Jumanji: a diverse suite of scalable reinforcement learning environments in jax","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:22.084295Z"},"links":{"cited_paper":"/paper/2306.09884","citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:70a537050b19bd727fd9cdebf2ee1eba1577c468b55df3c632527b68c183e1b6","observation_id":"148d73d9-d505-4656-9469-ff55e32f826b","resolution":{"observed_at":"2026-08-06T11:03:22.084295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.13066","last_updated":"2023-03-10T07:27:19Z","snapshot_observed_at":"2026-07-06T14:09:28.705784Z","submitted_at":"2022-10-24T09:33:59Z","title":"DaXBench: Benchmarking Deformable Object Manipulation with Differentiable Physics","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.13066","snapshot_observed_at":"2026-08-06T11:03:22.248755Z","title":"Daxbench: Benchmarking deformable object manipulation with differentiable physics","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:22.248755Z"},"links":{"cited_paper":"/paper/2210.13066","citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:27637fc151e9afcb68612e94d4fe6f00f9c134ac02f88496f2c0c8972fdbeec8","observation_id":"491e358b-41aa-4f9b-9660-e1946ef5fc3b","resolution":{"observed_at":"2026-08-06T11:03:22.248755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:03:38.661680Z","title":"Extreme parkour with legged robots","venue":null,"work_id":"2f3f03a2-9558-43f1-a905-2cac06249864","year":2024},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:22.450346Z"},"links":{"citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:c0360a5a2f883dd3441688180cd52e0a56f2b26063550a88efd02e6bc12c4732","observation_id":"312e53a3-d87f-4fef-81a8-051d536222d3","resolution":{"observed_at":"2026-08-06T11:03:38.787178Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:03:38.459525Z","title":"Leveraging procedural generation to benchmark reinforcement learning","venue":null,"work_id":"113beedd-0694-437c-a09b-d1fe33a9b6b2","year":2020},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:22.525109Z"},"links":{"citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:bc66e49e595c9eac24b183a55a879d5bb5cbd8db9ef71565cc31221b66c379b9","observation_id":"35b71f9c-0e24-4310-bd0f-c3675fd4cd26","resolution":{"observed_at":"2026-08-06T11:03:38.564219Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:03:38.261333Z","title":"Sample-efficient reinforcement learning by breaking the replay ratio barrier","venue":null,"work_id":"f4511169-372c-4bdb-b287-26192f017422","year":2022},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:22.601095Z"},"links":{"citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:f9e08ad25d534cd9611fbb2de3d1d9c738e6e3d84968e4ee51800239ec9a3852","observation_id":"faac1cd1-27bd-4bce-b510-9776a76ae743","resolution":{"observed_at":"2026-08-06T11:03:38.332518Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:03:22.724083Z","title":"Impala: Scalable distributed deep-rl with importance weighted actor-learner architectures","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:22.724083Z"},"links":{"citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:911c4a1e9b7faf50f441809bbcb7bd4cb743a07802f9f1c56ac53b016d20f444","observation_id":"bfddbf17-7840-428c-8808-b0106f042cda","resolution":{"observed_at":"2026-08-06T11:03:22.724083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:03:38.053270Z","title":"Franka emika panda robot, 2017","venue":null,"work_id":"d4bf2609-07f4-4cda-8e0e-0291888aba2d","year":2017},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:22.877103Z"},"links":{"citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:a95de3e6acb07d5f0c405bb762479d053a76c6f7424fb87b4457b7fbebc484aa","observation_id":"3870f6e1-a552-42ea-b335-6bc2d11dee6b","resolution":{"observed_at":"2026-08-06T11:03:38.161508Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.13281","last_updated":"2021-06-24T19:09:12Z","snapshot_observed_at":"2026-07-06T11:22:55.799017Z","submitted_at":"2021-06-24T19:09:12Z","title":"Brax -- A Differentiable Physics Engine for Large Scale Rigid Body Simulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.13281","snapshot_observed_at":"2026-08-06T11:03:22.998932Z","title":"Brax--a differentiable physics engine for large scale rigid body simulation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:22.998932Z"},"links":{"cited_paper":"/paper/2106.13281","citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:c48df83d6cc1c2e837bbc69e6a0a7b432c5eac8aa44456a224cf3c4f3ba5ad1e","observation_id":"54764a4d-0c94-40c1-abf4-a62653d42ccc","resolution":{"observed_at":"2026-08-06T11:03:22.998932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:03:37.877415Z","title":"Deep whole-body control: learning a unified policy for manipulation and locomotion","venue":null,"work_id":"54dbb7d8-4d4c-408c-ad3e-52f25e8f8990","year":2023},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:23.113116Z"},"links":{"citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:0e057d3dfecd6976e7ba338468484c07b86d664ba3d43277cb1b06e309673ce6","observation_id":"ccd60bd3-ae62-47bd-a072-3bd43242188b","resolution":{"observed_at":"2026-08-06T11:03:37.965262Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04811","last_updated":"2025-04-21T20:21:44Z","snapshot_observed_at":"2026-08-10T00:29:50.092385Z","submitted_at":"2024-07-05T18:49:07Z","title":"Simplifying Deep Temporal Difference Learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.04811","snapshot_observed_at":"2026-08-06T11:03:23.236918Z","title":"Simplifying deep temporal difference learning, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:23.236918Z"},"links":{"cited_paper":"/paper/2407.04811","citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:74ee91bf65a6e8477551b31ab32d70243888f1209b19bec33886ede462cd3ab7","observation_id":"ab8b6e32-c3dd-4343-aa03-25fb4bda2d62","resolution":{"observed_at":"2026-08-06T11:03:23.236918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.01290","last_updated":"2018-08-08T21:27:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-01-04T09:50:50Z","title":"Soft Actor-Critic: Off-Policy Maximum Entropy Deep Reinforcement Learning with a Stochastic Actor","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.01290","snapshot_observed_at":"2026-08-06T11:03:23.401536Z","title":"Soft actor-critic: Off-policy maximum entropy deep reinforcement learning with a stochastic actor, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:23.401536Z"},"links":{"cited_paper":"/paper/1801.01290","citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:1f851af731af84ccf6ec37de8fd9752cceec2906eeebc6a6557813b9b8f0c722","observation_id":"8459246d-52e0-4e88-b6a0-342a40ad399c","resolution":{"observed_at":"2026-08-06T11:03:23.401536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.11385","last_updated":"2024-05-05T16:04:52Z","snapshot_observed_at":"2026-07-06T16:49:41.895773Z","submitted_at":"2023-11-19T18:09:25Z","title":"Multi-Task Reinforcement Learning with Mixture of Orthogonal Experts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.11385","snapshot_observed_at":"2026-08-06T11:03:23.515122Z","title":"Multi-task reinforcement learning with mixture of orthogonal experts, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:23.515122Z"},"links":{"cited_paper":"/paper/2311.11385","citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:b00ebbb151e69b23ff34def3dc6c3b529893f3a618c1cbc857b5093ff8285900","observation_id":"7a321585-e291-49c4-9d6e-32adc78b4397","resolution":{"observed_at":"2026-08-06T11:03:23.515122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:03:37.691600Z","title":"Multi-task deep reinforcement learning with popart","venue":null,"work_id":"121ad201-d5ca-4ded-a245-b9081bc2778d","year":2019},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:23.598474Z"},"links":{"citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:9d3724bee628b212c3ee39d085118d3f688a88b474dbf8a095a4eb82bdd44351","observation_id":"d59c6f04-43fc-48a7-9b93-b6c32e809d66","resolution":{"observed_at":"2026-08-06T11:03:37.796592Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.00933","last_updated":"2018-03-02T16:21:46Z","snapshot_observed_at":"2026-07-06T06:26:20.207918Z","submitted_at":"2018-03-02T16:21:46Z","title":"Distributed Prioritized Experience Replay","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.00933","snapshot_observed_at":"2026-08-06T11:03:23.659631Z","title":"Distributed prioritized experience replay, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:23.659631Z"},"links":{"cited_paper":"/paper/1803.00933","citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:6f506af1d47fa32b11489e1f11d8b5225f06696cf07d20ea530a93a42f46d3a2","observation_id":"a46b7bb0-bc39-44d3-8dbf-881ccef46813","resolution":{"observed_at":"2026-08-06T11:03:23.659631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:03:23.793351Z","title":"Learning agile and dynamic motor skills for legged robots","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:23.793351Z"},"links":{"citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:b737f01998b616612d6468d6ed8cbce57ea30804b5397592d24e3b51c8f27408","observation_id":"9e9ffe28-7bb2-4d4b-b8a9-1b7cd0c3554b","resolution":{"observed_at":"2026-08-06T11:03:23.793351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1502.03167","last_updated":"2015-03-02T20:44:12Z","snapshot_observed_at":"2026-07-06T04:08:54.419941Z","submitted_at":"2015-02-11T01:44:18Z","title":"Batch Normalization: Accelerating Deep Network Training by Reducing Internal Covariate Shift","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1502.03167","snapshot_observed_at":"2026-08-06T11:03:23.880190Z","title":"Batch normalization: Accelerating deep network training by reducing internal covariate shift, 2015","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:23.880190Z"},"links":{"cited_paper":"/paper/1502.03167","citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:f678173ce05ac6ee8f80d977720b99632c6300505385f1ce838c8f5224f58a0d","observation_id":"f3258f4a-b1b9-43b5-b886-798a84a21ba2","resolution":{"observed_at":"2026-08-06T11:03:23.880190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:03:37.522815Z","title":null,"venue":null,"work_id":"5cb37d2d-412d-4b8a-b49f-d721f5df3c35","year":2020},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:23.976570Z"},"links":{"citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:bceef74a9dba9edb0547f2a6107bacef3629ea7d859b86741fa1a88eba1e0757","observation_id":"dd30d924-2919-47fd-aa93-5fedc6e7b561","resolution":{"observed_at":"2026-08-06T11:03:37.588503Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:03:37.370942Z","title":"A survey of zero-shot generalisation in deep reinforcement learning","venue":null,"work_id":"c3218286-d71a-4a6d-8002-8e7c4a907919","year":2023},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:24.116467Z"},"links":{"citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:a1831c4bc0e1f3575f0ee594aef8bab13381eed5bb42c8e06598d19125660898","observation_id":"5ab0480f-88c2-482e-8a09-ab1a4f53cc69","resolution":{"observed_at":"2026-08-06T11:03:37.457058Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:03:37.198030Z","title":"Pgx: Hardware-accelerated parallel game simulators for reinforcement learning","venue":null,"work_id":"8a935c8a-7af5-4b43-b055-00ae39816afa","year":2023},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:24.267463Z"},"links":{"citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:877c051d38142df4c29a66b201d5e028d87742e283e1874c7d1b6af1ce5264c7","observation_id":"4395375f-7a86-46d0-b96e-855ff9522a56","resolution":{"observed_at":"2026-08-06T11:03:37.298339Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:03:36.984739Z","title":"gymnax : A JAX -based reinforcement learning environment library, 2022","venue":null,"work_id":"2aa4698a-d976-47ea-abc9-3542f9289408","year":2022},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:24.397822Z"},"links":{"citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:a032bfb63802e66c6918d3dc7cd2fec891be629b773be5e2dfac0f2267a81a7f","observation_id":"0e12560f-4329-4fbf-8dd1-372ed53574d4","resolution":{"observed_at":"2026-08-06T11:03:37.121591Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:03:36.837538Z","title":"Learning quadrupedal locomotion over challenging terrain","venue":null,"work_id":"cafa388e-66b0-47a9-9c77-c70bfa6b7937","year":2020},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:24.559099Z"},"links":{"citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:f5a638ded7bd006b8348e5db72d8e3d54b6015bfa063c328013cc82e9c864596","observation_id":"5a40fe96-9794-4111-bade-18bcb46fbbfa","resolution":{"observed_at":"2026-08-06T11:03:36.887243Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:03:36.663886Z","title":"Parallel q -learning: Scaling off-policy reinforcement learning under massively parallel simulation","venue":null,"work_id":"9789a273-7886-45f3-909f-36acbd947d2f","year":2023},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:24.774942Z"},"links":{"citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:6eab2f8c764a89070d6f8c31b67f01be6d1c3027f06f778108afb986e2b6d24f","observation_id":"ae0ec9ea-4485-46d2-9123-ad50587f3a1b","resolution":{"observed_at":"2026-08-06T11:03:36.744012Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:03:36.471200Z","title":"Rllib: Abstractions for distributed reinforcement learning","venue":null,"work_id":"0c587336-a5c1-414b-b937-5e8f3f4062bb","year":2018},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:24.850498Z"},"links":{"citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:390d763641f3a258fbc2ae33ca344ba4dbe36406cdc0e82f54420e73da3ef090","observation_id":"364232bc-313b-4d15-8146-02d236d6c375","resolution":{"observed_at":"2026-08-06T11:03:36.568419Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:03:36.321512Z","title":"Gpu-accelerated robotic simulation for distributed reinforcement learning","venue":null,"work_id":"3e81b176-5ef9-432f-9b66-c2233c722a16","year":2018},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:25.062255Z"},"links":{"citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:c41a7d28c987976758ffafcbc950b2172a197f704189d542b0176d98cfd3b601","observation_id":"3ab1ae18-ad23-4ec2-a8df-b474ab50a07c","resolution":{"observed_at":"2026-08-06T11:03:36.382119Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01775","last_updated":"2024-11-04T03:54:00Z","snapshot_observed_at":"2026-07-06T19:44:34.642049Z","submitted_at":"2024-11-04T03:54:00Z","title":"Eurekaverse: Environment Curriculum Generation via Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.01775","snapshot_observed_at":"2026-08-06T11:03:25.196049Z","title":"Eurekaverse: Environment curriculum generation via large language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:25.196049Z"},"links":{"cited_paper":"/paper/2411.01775","citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:067965b79854cc245e0c468157d8050caabf013df9c3719310c6e60d648ae295","observation_id":"d37a556b-2458-43da-919f-b8703e104bfc","resolution":{"observed_at":"2026-08-06T11:03:25.196049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03792","last_updated":"2023-10-30T02:45:50Z","snapshot_observed_at":"2026-08-10T13:09:02.497714Z","submitted_at":"2023-06-06T15:39:54Z","title":"FAMO: Fast Adaptive Multitask Optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.03792","snapshot_observed_at":"2026-08-06T11:03:25.316396Z","title":"Famo: Fast adaptive multitask optimization, 2023 a","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:25.316396Z"},"links":{"cited_paper":"/paper/2306.03792","citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:f1f87034cb58ee44b23eca1f213d822ed6ec2e6565a2c74608cbe2c283d4ee43","observation_id":"47eec33a-a586-4242-80be-6a08a54dd6b5","resolution":{"observed_at":"2026-08-06T11:03:25.316396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03310","last_updated":"2023-10-14T15:52:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-05T23:32:26Z","title":"LIBERO: Benchmarking Knowledge Transfer for Lifelong Robot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.03310","snapshot_observed_at":"2026-08-06T11:03:25.514380Z","title":"Libero: Benchmarking knowledge transfer for lifelong robot learning, 2023 b","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:25.514380Z"},"links":{"cited_paper":"/paper/2306.03310","citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:b8fb866d56c1f875825401ec1d00ddae9c72e017aacb5498019783f87d6c21e4","observation_id":"089e5355-0b7b-4230-b443-348793f2127b","resolution":{"observed_at":"2026-08-06T11:03:25.514380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14048","last_updated":"2024-02-21T04:18:38Z","snapshot_observed_at":"2026-08-10T13:06:16.750257Z","submitted_at":"2021-10-26T22:03:51Z","title":"Conflict-Averse Gradient Descent for Multi-task Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14048","snapshot_observed_at":"2026-08-06T11:03:25.650538Z","title":"Conflict-averse gradient descent for multi-task learning, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:25.650538Z"},"links":{"cited_paper":"/paper/2110.14048","citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:115868650205e31ad240b5a72fec3e343bf3bd3f471016ef5aa6046ea5cf09d4","observation_id":"9dcc7e5e-a8a9-45e2-b9b0-eefce8af99a2","resolution":{"observed_at":"2026-08-06T11:03:25.650538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:03:36.125804Z","title":"Perpetual humanoid control for real-time simulated avatars","venue":null,"work_id":"a95ea507-03aa-43db-b1b4-6a40be8bc589","year":2023},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:25.817066Z"},"links":{"citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:447133958546a4e27741aca38e754a51267bd632b93b096728f115b31e6f996a","observation_id":"6e5a73cd-437f-4547-aef0-4bc354ce73fd","resolution":{"observed_at":"2026-08-06T11:03:36.210790Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:03:35.915043Z","title":"rl-games: A high-performance framework for reinforcement learning","venue":null,"work_id":"eef3a711-47c5-4944-8c2e-8407ec6c1685","year":2021},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:26.017917Z"},"links":{"citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:cd170dd985896c94c3731b37bbe906dafcf04d137f7b116f465a4a9774236707","observation_id":"54044885-8e42-4ff7-82e6-3826c246efd0","resolution":{"observed_at":"2026-08-06T11:03:36.036181Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.10470","last_updated":"2021-08-25T23:42:59Z","snapshot_observed_at":"2026-07-06T11:40:56.544714Z","submitted_at":"2021-08-24T01:38:11Z","title":"Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.10470","snapshot_observed_at":"2026-08-06T11:03:26.184138Z","title":"Isaac gym: High performance gpu-based physics simulation for robot learning, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:26.184138Z"},"links":{"cited_paper":"/paper/2108.10470","citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:69e838b4470334f98cb3101d0070992900b58b1032bb16e589c5eb69f2b75c26","observation_id":"ce8db6ca-13f9-4303-8011-c66f60ef4308","resolution":{"observed_at":"2026-08-06T11:03:26.184138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:03:26.290341Z","title":"Rapid locomotion via reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:26.290341Z"},"links":{"citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:6737ee8bdef6706f27533bdfc7cb8a1267610563079de7fbdf48ecae75a27498","observation_id":"51f0bb4e-13d4-4c88-b0d5-0942b92d19ff","resolution":{"observed_at":"2026-08-06T11:03:26.290341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16801","last_updated":"2024-06-03T14:12:27Z","snapshot_observed_at":"2026-08-09T06:30:15.638276Z","submitted_at":"2024-02-26T18:19:07Z","title":"Craftax: A Lightning-Fast Benchmark for Open-Ended Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.16801","snapshot_observed_at":"2026-08-06T11:03:26.459024Z","title":"Craftax: A lightning-fast benchmark for open-ended reinforcement learning, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:26.459024Z"},"links":{"cited_paper":"/paper/2402.16801","citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:ce5a552a4847729f88e85ab0d22459cbc6b6236f801861a432081bf85b6b6e57","observation_id":"d54f2052-a4f1-4f94-88de-cc7103c26e2b","resolution":{"observed_at":"2026-08-06T11:03:26.459024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:03:26.674694Z","title":"Orbit: A unified simulation framework for interactive robot learning environments","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:26.674694Z"},"links":{"citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:7f5e43a2c12538f51026f17a1367d8a6364ae12a5d47c159ba5dec5efa28fe26","observation_id":"bb8220b2-4ab6-4d99-bfc5-e802104815c9","resolution":{"observed_at":"2026-08-06T11:03:26.674694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1312.5602","last_updated":"2013-12-19T16:00:08Z","snapshot_observed_at":"2026-07-06T03:31:23.521122Z","submitted_at":"2013-12-19T16:00:08Z","title":"Playing Atari with Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.5602","snapshot_observed_at":"2026-08-06T11:03:26.825320Z","title":"Playing atari with deep reinforcement learning, 2013","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:26.825320Z"},"links":{"cited_paper":"/paper/1312.5602","citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:df4a70d39be913f2dee37f23120c086c966b4ad47fe741bfdb95ed6d6c658dd3","observation_id":"549915d5-7361-4756-a42a-b11ed3a2739d","resolution":{"observed_at":"2026-08-06T11:03:26.825320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:03:35.764432Z","title":"Rusu, Joel Veness, Marc G","venue":null,"work_id":"8881227d-660e-49f4-b372-19a54171e444","year":2015},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:26.959536Z"},"links":{"citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:ec2787873fba63962214b383783f493966150121ef15f1ba6aae65ec4367e1fc","observation_id":"657a0540-9a52-41b7-9faf-4514d3bfd4bb","resolution":{"observed_at":"2026-08-06T11:03:35.834992Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:03:27.178424Z","title":"Asynchronous methods for deep reinforcement learning","venue":null,"work_id":null,"year":1928},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:27.178424Z"},"links":{"citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:579200bc95692e1d793571a27d367a933d0e81ded2949f2917efd2420bafca9f","observation_id":"042c9cc2-100a-4ca5-a884-dab096552ee5","resolution":{"observed_at":"2026-08-06T11:03:27.178424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.01859","last_updated":"2023-03-03T11:25:33Z","snapshot_observed_at":"2026-07-06T14:58:18.255439Z","submitted_at":"2023-03-03T11:25:33Z","title":"POPGym: Benchmarking Partially Observable Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.01859","snapshot_observed_at":"2026-08-06T11:03:27.386150Z","title":"Popgym: Benchmarking partially observable reinforcement learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:27.386150Z"},"links":{"cited_paper":"/paper/2303.01859","citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:8616be00dc2547d0199e7d5ced15d44ba49a2638838175a4e9880dcf0ddc1c9e","observation_id":"6adb8350-b470-4884-8cee-2a8e9ef67971","resolution":{"observed_at":"2026-08-06T11:03:27.386150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1507.04296","last_updated":"2015-07-16T09:27:06Z","snapshot_observed_at":"2026-07-06T04:23:57.382398Z","submitted_at":"2015-07-15T16:56:56Z","title":"Massively Parallel Methods for Deep Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1507.04296","snapshot_observed_at":"2026-08-06T11:03:27.536045Z","title":"Massively parallel methods for deep reinforcement learning","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:27.536045Z"},"links":{"cited_paper":"/paper/1507.04296","citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:a0fd17628b34033c2452e25594a4266223d6f02500ac2b3a55b237db1e5d78d8","observation_id":"60f8519e-7bb0-4d02-a5dd-db22594ca89e","resolution":{"observed_at":"2026-08-06T11:03:27.536045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1808.00177","last_updated":"2019-01-18T23:26:53Z","snapshot_observed_at":"2026-08-10T08:48:52.117613Z","submitted_at":"2018-08-01T06:02:36Z","title":"Learning Dexterous In-Hand Manipulation","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1808.00177","snapshot_observed_at":"2026-08-06T11:03:27.683420Z","title":"Learning dexterous in-hand manipulation, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:27.683420Z"},"links":{"cited_paper":"/paper/1808.00177","citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:6cdd7fe10b45c167f842232e0f739ff6c342dfa143ae58d6031786018d7e03aa","observation_id":"21094dcb-5b7d-4cdc-9496-eda1c508bba8","resolution":{"observed_at":"2026-08-06T11:03:27.683420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.20092","last_updated":"2025-02-13T18:38:13Z","snapshot_observed_at":"2026-08-09T00:27:34.912875Z","submitted_at":"2024-10-26T06:06:08Z","title":"OGBench: Benchmarking Offline Goal-Conditioned RL","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.20092","snapshot_observed_at":"2026-08-06T11:03:27.866008Z","title":"Ogbench: Benchmarking offline goal-conditioned rl","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:27.866008Z"},"links":{"cited_paper":"/paper/2410.20092","citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:766821f9f0074f800d27d8971ce5504fde1b25bc4b2136a20d4cbd1c9cf9661a","observation_id":"94b606da-e505-4439-a907-8aea010ac98d","resolution":{"observed_at":"2026-08-06T11:03:27.866008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:03:35.624075Z","title":"Sample factory: Egocentric 3d control from pixels at 100000 fps with asynchronous reinforcement learning","venue":null,"work_id":"6e3e20a6-1455-4cf7-bcfd-0e4ba6099734","year":2020},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:28.009488Z"},"links":{"citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:58d289399a3960f175e1e59e14be1ed89aeaa481ca1804046c1944abcae45ae3","observation_id":"8025aec0-f76e-4f0f-80f3-3c664fa6c409","resolution":{"observed_at":"2026-08-06T11:03:35.709263Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1609.09025","last_updated":"2016-09-28T18:13:02Z","snapshot_observed_at":"2026-07-06T05:12:36.053923Z","submitted_at":"2016-09-28T18:13:02Z","title":"Learning to Push by Grasping: Using multiple tasks for effective learning","version":1},"cited_work":{"arxiv_id":"1609.09025","doi":null,"metadata_source":"pith","pith_arxiv_id":"1609.09025","snapshot_observed_at":"2026-08-06T11:03:32.898528Z","title":"Learning to Push by Grasping: Using multiple tasks for effective learning","venue":"cs.RO","work_id":"9341ca39-08f8-4146-a071-55998ebbb4ec","year":2016},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:28.133785Z"},"links":{"cited_paper":"/paper/1609.09025","citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:278975bfa854464a9befb7d32f0ca616e86d0669c26ae9dae7afed9f34b73264","observation_id":"56cf0269-8829-47f6-9178-353ac92748be","resolution":{"observed_at":"2026-08-06T11:03:33.005502Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:03:35.466681Z","title":"Learning to walk in minutes using massively parallel deep reinforcement learning","venue":null,"work_id":"c5326624-c19b-435b-a161-6e10f0c8551c","year":2022},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:28.332033Z"},"links":{"citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:47bd4a5b82b0414db7f74bfe78a48d46d3e6fff201f9e81e4d298f7c5fdf76c4","observation_id":"a31f0dba-12cf-4f62-b3ad-670077d431ca","resolution":{"observed_at":"2026-08-06T11:03:35.534278Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10090","last_updated":"2026-07-04T05:19:25Z","snapshot_observed_at":"2026-08-09T03:06:29.095333Z","submitted_at":"2023-11-16T18:58:43Z","title":"JaxMARL: Multi-Agent RL Environments and Algorithms in JAX","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10090","snapshot_observed_at":"2026-08-06T11:03:28.485294Z","title":"Jaxmarl: Multi-agent rl environments and algorithms in jax, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:28.485294Z"},"links":{"cited_paper":"/paper/2311.10090","citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:25f64d571dd7cbc3b80ab0453f66881973fd8aca6892be4a2ef333df3abc49dd","observation_id":"40a0afb0-41b0-49d2-8666-7bfd43cfeec4","resolution":{"observed_at":"2026-08-06T11:03:28.485294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-06T11:03:28.602247Z","title":"Proximal policy optimization algorithms, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:28.602247Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:8aed7c91723371a2f451057c4306283a74e95b756cc20d7e82e4fc16d9b9435c","observation_id":"842ede67-ce26-4d2e-9dcf-cef77f684586","resolution":{"observed_at":"2026-08-06T11:03:28.602247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.12566","last_updated":"2023-09-25T22:49:51Z","snapshot_observed_at":"2026-08-05T18:50:45.868771Z","submitted_at":"2022-10-22T22:55:50Z","title":"Solving Continuous Control via Q-learning","version":2},"cited_work":{"arxiv_id":"2210.12566","doi":null,"metadata_source":"pith","pith_arxiv_id":"2210.12566","snapshot_observed_at":"2026-08-06T11:03:32.537682Z","title":"Solving Continuous Control via Q-learning","venue":"cs.LG","work_id":"b0ac7bb0-ac22-4dc2-8c68-dba6ca29744f","year":2022},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:28.770546Z"},"links":{"cited_paper":"/paper/2210.12566","citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:a54ff1c0a592c7a7fbf50601d6c656cd6b3d7d06dfc18c9683531783b796854f","observation_id":"0ee4ca13-facb-48a3-9191-b09fb5d5866d","resolution":{"observed_at":"2026-08-06T11:03:32.734490Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.10506","last_updated":"2024-06-18T18:11:07Z","snapshot_observed_at":"2026-08-04T05:16:12.953751Z","submitted_at":"2024-03-15T17:45:44Z","title":"HumanoidBench: Simulated Humanoid Benchmark for Whole-Body Locomotion and Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.10506","snapshot_observed_at":"2026-08-06T11:03:28.917713Z","title":"Humanoidbench: Simulated humanoid benchmark for whole-body locomotion and manipulation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:28.917713Z"},"links":{"cited_paper":"/paper/2403.10506","citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:4900e39780d02f06cfe75fa309655c2ac8136ebc0bb64921a71fda7769ca6b75","observation_id":"d968c205-8934-42fd-b2a7-ad78bab7f571","resolution":{"observed_at":"2026-08-06T11:03:28.917713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-06T11:03:29.080753Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:29.080753Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:1c9bb0850dc8d5287d8ffab68112fd45ac416be82b00dc8a5c22b1d0fe3e48fb","observation_id":"8291e303-13cf-4d50-8383-79c9691d366f","resolution":{"observed_at":"2026-08-06T11:03:29.080753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:03:29.291269Z","title":"Mastering the game of go with deep neural networks and tree search","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:29.291269Z"},"links":{"citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:c2c26c68f42e843d069f7b12aa18b9f5313269c788aa86a481c15f7cca3934c7","observation_id":"0b2a84a9-6694-411d-a3a9-4ee50ab02404","resolution":{"observed_at":"2026-08-06T11:03:29.291269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:03:35.128592Z","title":"Sapg: Split and aggregate policy gradients","venue":null,"work_id":"f941d7da-a7b5-486a-bb23-c51062b4185f","year":2024},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:29.405988Z"},"links":{"citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:aa70354d7ad64eb32a0980d51f32d6322bc5a40790614ce8815e5344e89ce7dc","observation_id":"8edd2085-984b-4cd6-a003-1f3f81c939a4","resolution":{"observed_at":"2026-08-06T11:03:35.336689Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:03:34.816529Z","title":"Mtrl - multi task rl algorithms","venue":null,"work_id":"4a481532-7248-43a1-8f29-c86984b622a1","year":2021},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:29.509725Z"},"links":{"citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:460c4aabcaa3c5c70970fac5142bf14d55960cd420c0d3c077539289e6a035bc","observation_id":"b44df3ee-a281-468c-8b6e-fd5c22f9e1ed","resolution":{"observed_at":"2026-08-06T11:03:34.953844Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:03:34.483305Z","title":"Multi-task reinforcement learning with context-based representations","venue":null,"work_id":"ad388d68-2df2-482e-81e1-5c3a24b1fae3","year":2021},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:29.666591Z"},"links":{"citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:d04dc52147a5449544eb3bdea85aef299572fd49b5960f50dafacfa4500de3ad","observation_id":"b98ea7ac-7bc8-4b88-9745-60fcd076016a","resolution":{"observed_at":"2026-08-06T11:03:34.630161Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.11653","last_updated":"2022-10-21T01:00:10Z","snapshot_observed_at":"2026-07-06T14:08:30.259555Z","submitted_at":"2022-10-21T01:00:10Z","title":"PaCo: Parameter-Compositional Multi-Task Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.11653","snapshot_observed_at":"2026-08-06T11:03:29.790459Z","title":"Paco: Parameter-compositional multi-task reinforcement learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:29.790459Z"},"links":{"cited_paper":"/paper/2210.11653","citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:0a9081e6456bf4b55d0fa5550dafc3d0fa5f015d2d487be33fab6c4b7f9e2de6","observation_id":"73c4d6a4-1bee-416e-a3ef-9a44468a2bb7","resolution":{"observed_at":"2026-08-06T11:03:29.790459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1706.05296","last_updated":"2017-06-16T14:47:21Z","snapshot_observed_at":"2026-07-06T05:47:10.770104Z","submitted_at":"2017-06-16T14:47:21Z","title":"Value-Decomposition Networks For Cooperative Multi-Agent Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.05296","snapshot_observed_at":"2026-08-06T11:03:29.901954Z","title":"Leibo, Karl Tuyls, and Thore Graepel","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:29.901954Z"},"links":{"cited_paper":"/paper/1706.05296","citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:ec68a31427c49ea8c093fc1c67054a2f33990d00a800a90cf932be3cf9c86799","observation_id":"4c905634-aadf-4819-961e-8212124c9f4b","resolution":{"observed_at":"2026-08-06T11:03:29.901954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:03:30.091789Z","title":"Policy gradient methods for reinforcement learning with function approximation","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:30.091789Z"},"links":{"citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:9481cb9c940d917029b4fde23611322638e7fdb5a4f59ba3ab3a9011f1622b41","observation_id":"914f3f29-610e-43fc-bde4-5c3aa65780a4","resolution":{"observed_at":"2026-08-06T11:03:30.091789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.00425","last_updated":"2025-05-30T05:49:14Z","snapshot_observed_at":"2026-07-06T19:25:06.162911Z","submitted_at":"2024-10-01T06:10:39Z","title":"ManiSkill3: GPU Parallelized Robotics Simulation and Rendering for Generalizable Embodied AI","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.00425","snapshot_observed_at":"2026-08-06T11:03:30.239033Z","title":"Maniskill3: Gpu parallelized robotics simulation and rendering for generalizable embodied ai","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:30.239033Z"},"links":{"cited_paper":"/paper/2410.00425","citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:f41f2a51b1890ad2faa6e416553d242ce221750d8357b2739cce09857d6c1910","observation_id":"9ea2fe3f-5da3-46b9-84fa-74f99b29251f","resolution":{"observed_at":"2026-08-06T11:03:30.239033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-01T20:24:08.300098Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.00690","snapshot_observed_at":"2026-08-06T11:03:30.405738Z","title":"Deepmind control suite, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:30.405738Z"},"links":{"cited_paper":"/paper/1801.00690","citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:f431c54bc46e135bc2cfacfc1d0f0ed49a091f62c4c40220d88992e9a45489db","observation_id":"68c89edc-604f-4cc5-9864-f4518319b735","resolution":{"observed_at":"2026-08-06T11:03:30.405738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:03:30.591670Z","title":"Mujoco: A physics engine for model-based control","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:30.591670Z"},"links":{"citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:b41cbf7bc20bcc1a34cac12cafd700295c8de0b6eb127e2c9483bd71e1ed3b19","observation_id":"bcf13415-3bb3-4bda-997f-b352ffbfb748","resolution":{"observed_at":"2026-08-06T11:03:30.591670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:03:34.190368Z","title":"Go1 User Manual","venue":null,"work_id":"0e4c48ad-3bf6-4e68-9ad0-cd064968e091","year":2021},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:30.727389Z"},"links":{"citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:2592f48b4b5b7cb0debae1a60c825821d048f3e72e00a7ffc2e40c93bab4e199","observation_id":"2e5a82a9-c46a-48eb-9fff-257bfa6a15c9","resolution":{"observed_at":"2026-08-06T11:03:34.371334Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1511.06581","last_updated":"2016-04-05T09:03:06Z","snapshot_observed_at":"2026-08-10T06:38:22.014739Z","submitted_at":"2015-11-20T13:07:54Z","title":"Dueling Network Architectures for Deep Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1511.06581","snapshot_observed_at":"2026-08-06T11:03:30.851313Z","title":"Dueling network architectures for deep reinforcement learning, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:30.851313Z"},"links":{"cited_paper":"/paper/1511.06581","citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:d26ba8c04cacb3eb3f3877764ab39a859fc56b5ab3405b101187d3c7be303d1d","observation_id":"79daa933-3cb6-46f4-adc2-430add7b2e7d","resolution":{"observed_at":"2026-08-06T11:03:30.851313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:03:33.959803Z","title":"Outracing champion gran turismo drivers with deep reinforcement learning","venue":null,"work_id":"d21fcb26-bfde-4624-ae86-7d75ccc99145","year":2022},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:30.999200Z"},"links":{"citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:c9c07086fbe265bc9a7f34bd47fba14682b9cda36e63166afffa343f48f54b94","observation_id":"76425055-dca4-44c7-be27-c1107a9aa233","resolution":{"observed_at":"2026-08-06T11:03:34.063335Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.12089","last_updated":"2025-02-27T19:05:47Z","snapshot_observed_at":"2026-07-06T20:07:58.873037Z","submitted_at":"2024-12-16T18:56:24Z","title":"Stabilizing Reinforcement Learning in Differentiable Multiphysics Simulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.12089","snapshot_observed_at":"2026-08-06T11:03:31.098377Z","title":"Stabilizing reinforcement learning in differentiable multiphysics simulation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:31.098377Z"},"links":{"cited_paper":"/paper/2412.12089","citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:9acc0b7720d99eb460bfd19b1d2decb250818b5fa6250364b7438619eee83faf","observation_id":"e35af45e-1f0b-448d-b13c-8b2845a3e1bb","resolution":{"observed_at":"2026-08-06T11:03:31.098377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2003.13661","last_updated":"2020-12-07T07:14:11Z","snapshot_observed_at":"2026-08-09T00:17:46.244466Z","submitted_at":"2020-03-30T17:47:04Z","title":"Multi-Task Reinforcement Learning with Soft Modularization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2003.13661","snapshot_observed_at":"2026-08-06T11:03:31.215734Z","title":"Multi-task reinforcement learning with soft modularization, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:31.215734Z"},"links":{"cited_paper":"/paper/2003.13661","citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:e26990a264b10fd58d0cb84cb6825e58cc41fc4dd32941459fc30d1b5e9c58dc","observation_id":"b81ebc2e-3859-43b7-8cf5-1912b4c15131","resolution":{"observed_at":"2026-08-06T11:03:31.215734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.06782","last_updated":"2020-12-22T00:35:46Z","snapshot_observed_at":"2026-08-10T13:07:02.974893Z","submitted_at":"2020-01-19T06:33:47Z","title":"Gradient Surgery for Multi-Task Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.06782","snapshot_observed_at":"2026-08-06T11:03:31.393593Z","title":"Gradient surgery for multi-task learning, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:31.393593Z"},"links":{"cited_paper":"/paper/2001.06782","citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:26654d5c23d985b65361558b46f216dc45b5f89754db4836637ed7935e5f8437","observation_id":"6f03fb84-dc42-4b67-b1a5-abfff31214d3","resolution":{"observed_at":"2026-08-06T11:03:31.393593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.10897","last_updated":"2021-06-14T18:45:16Z","snapshot_observed_at":"2026-07-06T08:31:50.962710Z","submitted_at":"2019-10-24T03:19:46Z","title":"Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.10897","snapshot_observed_at":"2026-08-06T11:03:31.574523Z","title":"Meta-world: A benchmark and evaluation for multi-task and meta reinforcement learning, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:31.574523Z"},"links":{"cited_paper":"/paper/1910.10897","citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:da4167404d68b07185d1814dbf1af5c24acd5579de434dbc21e9e1d882b7b885","observation_id":"54e0e1a9-2db9-4aba-94b0-ea133a08d417","resolution":{"observed_at":"2026-08-06T11:03:31.574523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:03:33.680722Z","title":"Kahrs, Carlo Sferrazza, Yuval Tassa, and Pieter Abbeel","venue":null,"work_id":"160c8d5f-0fba-4fd7-b791-d149adb855b2","year":2025},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:31.762955Z"},"links":{"citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:ea0ef9c4662dd2ad9d3631b621602fd02e8f28457bdf1674a2a59e076b0c0e87","observation_id":"1687d3a9-5815-4d30-ad87-3707271c1528","resolution":{"observed_at":"2026-08-06T11:03:33.804878Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.12293","last_updated":"2025-01-18T02:57:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-09-25T15:32:31Z","title":"robosuite: A Modular Simulation Framework and Benchmark for Robot Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.12293","snapshot_observed_at":"2026-08-06T11:03:31.888331Z","title":"robosuite: A modular simulation framework and benchmark for robot learning","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:31.888331Z"},"links":{"cited_paper":"/paper/2009.12293","citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:3ca817946299305dc3a0209a0e88181033720cc8fbff79855913f62e54792fdc","observation_id":"745be101-15cf-404c-8fa4-113e362d9d90","resolution":{"observed_at":"2026-08-06T11:03:31.888331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05665","last_updated":"2023-09-12T03:01:55Z","snapshot_observed_at":"2026-07-06T16:17:04.004519Z","submitted_at":"2023-09-11T17:59:17Z","title":"Robot Parkour Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.05665","snapshot_observed_at":"2026-08-06T11:03:32.055516Z","title":"Robot parkour learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:32.055516Z"},"links":{"cited_paper":"/paper/2309.05665","citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:dfd5b8f5774e94c35f19ae5a562ed8eeb37397fa93c3a82788027813fbf6dc67","observation_id":"a99782d8-5d50-41a7-b8e4-d33ff230ed85","resolution":{"observed_at":"2026-08-06T11:03:32.055516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:03:32.220111Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:32.220111Z"},"links":{"citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:2f280f645b72c222a627431cc32cbf1b7cd0831340ddaca9f8c0b2ab98fa7b39","observation_id":"3610a66a-7b43-46b3-a45f-9d670e20b58c","resolution":{"observed_at":"2026-08-06T11:03:32.220111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","latest_version":2,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks"},"reference_resolution":{"displayed":75,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":47,"verified_exact":3,"verified_fuzzy":25},"total_outbound_references":75},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 75 of 75 outbound references and 3 inbound Pith citation observations for arXiv:2507.23172."}