{"as_of":"2026-08-10T11:28:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e44c2f9f8ce40de9ab75c5f3280dc28eb00547e131321e529bb354fb6264b73c","coverage":[{"denominator":118,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:58:54.542081Z","state":"measured"},{"denominator":109,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":109,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":9,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":9,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T04:39:05.516882Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-20T23:09:12.737900Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-09T00:14:25.317749Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23150","snapshot_observed_at":"2026-08-06T04:39:05.516882Z","title":"Bigger, regularized, categorical: High-capacity value functions are efficient multi-task learners","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.03194","last_updated":"2025-08-05T08:03:12Z","snapshot_observed_at":"2026-08-06T11:32:36.516059Z","submitted_at":"2025-08-05T08:03:12Z","title":"Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T04:39:05.516882Z"},"links":{"cited_paper":"/paper/2505.23150","citing_paper":"/paper/2508.03194"},"observation_digest":"sha256:b532cb120e1cdfa777fc8a1a95d036802b37d2ef1a34deeb1f71822813fa2b08","observation_id":"bc77ead2-1f30-42fd-9916-5280d93a49ee","resolution":{"observed_at":"2026-08-06T04:39:05.516882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-09T00:14:25.317749Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23150","snapshot_observed_at":"2026-08-03T06:26:50.060301Z","title":"Mnih, V ., Badia, A","venue":null,"work_id":null,"year":1928},"citing_paper":{"arxiv_id":"2601.23075","last_updated":"2026-06-23T21:44:31Z","snapshot_observed_at":"2026-08-03T06:17:20.457387Z","submitted_at":"2026-01-30T15:24:34Z","title":"RN-D: Discretized Categorical Actors for On-Policy Reinforcement Learning","version":2},"reference_index":1937,"source":"pdf_text","source_observed_at":"2026-08-03T06:26:50.060301Z"},"links":{"cited_paper":"/paper/2505.23150","citing_paper":"/paper/2601.23075"},"observation_digest":"sha256:d96ebcbf09b1c324d240adf0be292b3198f54bbd4156f674e9eb851d38d4d14c","observation_id":"0b865dce-dccd-424b-8539-56b73b144627","resolution":{"observed_at":"2026-08-03T06:26:50.060301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-09T00:14:25.317749Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"cited_work":{"arxiv_id":"2505.23150","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23150","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bigger, regularized, categorical: High-capacity value functions are efficient multi-task learners","venue":null,"work_id":"c5878a7d-e0b1-4609-a5bd-5b7abc87de3a","year":2025},"citing_paper":{"arxiv_id":"2603.04333","last_updated":"2026-05-08T20:08:31Z","snapshot_observed_at":"2026-07-31T16:31:42.095039Z","submitted_at":"2026-03-04T17:51:30Z","title":"What Does Flow Matching Bring To TD Learning?","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-15T16:32:29.432272Z"},"links":{"cited_paper":"/paper/2505.23150","citing_paper":"/paper/2603.04333"},"observation_digest":"sha256:8e0963c02689c8f17a32cd2a8487960e6ff6ecb57a525fc7f7d5ff403292aaf5","observation_id":"60621c76-8d7e-4e50-99fc-2dba385bb7b0","resolution":{"observed_at":"2026-05-15T16:36:17.973880Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-09T00:14:25.317749Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"cited_work":{"arxiv_id":"2505.23150","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23150","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bigger, regularized, categorical: High-capacity value functions are efficient multi-task learners","venue":null,"work_id":"c5878a7d-e0b1-4609-a5bd-5b7abc87de3a","year":2025},"citing_paper":{"arxiv_id":"2604.04539","last_updated":"2026-05-15T07:15:36Z","snapshot_observed_at":"2026-08-02T17:13:51.910717Z","submitted_at":"2026-04-06T09:03:41Z","title":"FlashSAC: Fast and Stable Off-Policy Reinforcement Learning for High-Dimensional Robot Control","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-10T20:04:56.512544Z"},"links":{"cited_paper":"/paper/2505.23150","citing_paper":"/paper/2604.04539"},"observation_digest":"sha256:70b615045a9fef86325f6f469fbe2ea27429cb911e347664a19ebcfefabeaf66","observation_id":"888cc10a-ff82-4837-a3e4-b20e78351f66","resolution":{"observed_at":"2026-05-10T22:15:49.716390Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-09T00:14:25.317749Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"cited_work":{"arxiv_id":"2505.23150","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23150","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bigger, regularized, categorical: High-capacity value functions are efficient multi-task learners","venue":null,"work_id":"c5878a7d-e0b1-4609-a5bd-5b7abc87de3a","year":2025},"citing_paper":{"arxiv_id":"2604.04539","last_updated":"2026-05-15T07:15:36Z","snapshot_observed_at":"2026-08-02T17:13:51.910717Z","submitted_at":"2026-04-06T09:03:41Z","title":"FlashSAC: Fast and Stable Off-Policy Reinforcement Learning for High-Dimensional Robot Control","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-19T17:08:31.770889Z"},"links":{"cited_paper":"/paper/2505.23150","citing_paper":"/paper/2604.04539"},"observation_digest":"sha256:d65a5336983cb255e800a6dba52eb62bf9f862f52bb51c985c22c236d0374f7a","observation_id":"9c5a25c9-0ec3-42b4-81d1-2f0be6bf0658","resolution":{"observed_at":"2026-05-19T17:12:41.363803Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-09T00:14:25.317749Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"cited_work":{"arxiv_id":"2505.23150","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23150","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bigger, regularized, categorical: High-capacity value functions are efficient multi-task learners","venue":null,"work_id":"c5878a7d-e0b1-4609-a5bd-5b7abc87de3a","year":2025},"citing_paper":{"arxiv_id":"2605.10236","last_updated":"2026-05-17T21:09:20Z","snapshot_observed_at":"2026-08-06T08:24:06.705324Z","submitted_at":"2026-05-11T09:11:05Z","title":"When Does Non-Uniform Replay Matter in Reinforcement Learning?","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-12T05:33:19.038889Z"},"links":{"cited_paper":"/paper/2505.23150","citing_paper":"/paper/2605.10236"},"observation_digest":"sha256:417362bcc4313ee2fbbf50f84ac911868758c59fc98890932803452f0ee78c36","observation_id":"309e830e-b3ea-45f2-9ca8-588e9c61e2ee","resolution":{"observed_at":"2026-05-12T05:36:24.607354Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-09T00:14:25.317749Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"cited_work":{"arxiv_id":"2505.23150","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23150","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bigger, regularized, categorical: High-capacity value functions are efficient multi-task learners","venue":null,"work_id":"c5878a7d-e0b1-4609-a5bd-5b7abc87de3a","year":2025},"citing_paper":{"arxiv_id":"2605.10236","last_updated":"2026-05-17T21:09:20Z","snapshot_observed_at":"2026-08-06T08:24:06.705324Z","submitted_at":"2026-05-11T09:11:05Z","title":"When Does Non-Uniform Replay Matter in Reinforcement Learning?","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-13T06:27:38.643667Z"},"links":{"cited_paper":"/paper/2505.23150","citing_paper":"/paper/2605.10236"},"observation_digest":"sha256:610c3f1d0acb241d458c446d1c225ec338a1102b9d86ad5b80b0862601d00d19","observation_id":"2664d873-3fe7-4957-8bac-b87353feff58","resolution":{"observed_at":"2026-05-13T06:32:24.804374Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-09T00:14:25.317749Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"cited_work":{"arxiv_id":"2505.23150","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23150","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bigger, regularized, categorical: High-capacity value functions are efficient multi-task learners","venue":null,"work_id":"c5878a7d-e0b1-4609-a5bd-5b7abc87de3a","year":2025},"citing_paper":{"arxiv_id":"2605.10236","last_updated":"2026-05-17T21:09:20Z","snapshot_observed_at":"2026-08-06T08:24:06.705324Z","submitted_at":"2026-05-11T09:11:05Z","title":"When Does Non-Uniform Replay Matter in Reinforcement Learning?","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-20T23:04:12.943222Z"},"links":{"cited_paper":"/paper/2505.23150","citing_paper":"/paper/2605.10236"},"observation_digest":"sha256:32d188fb1797a68af7c69e0f276929d020ca15bed0bb2f7e8b589d387acd36a8","observation_id":"85285cc0-7eaf-4f1f-be3b-64a47fdd07a0","resolution":{"observed_at":"2026-05-20T23:09:12.743772Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-09T00:14:25.317749Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"cited_work":{"arxiv_id":"2505.23150","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23150","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bigger, regularized, categorical: High-capacity value functions are efficient multi-task learners","venue":null,"work_id":"c5878a7d-e0b1-4609-a5bd-5b7abc87de3a","year":2025},"citing_paper":{"arxiv_id":"2605.11711","last_updated":"2026-05-12T08:02:34Z","snapshot_observed_at":"2026-07-06T23:23:30.499023Z","submitted_at":"2026-05-12T08:02:34Z","title":"Debiased Model-based Representations for Sample-efficient Continuous Control","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-13T07:09:01.132424Z"},"links":{"cited_paper":"/paper/2505.23150","citing_paper":"/paper/2605.11711"},"observation_digest":"sha256:04e1a17deb761a9a15a963f4dee0fdc318ba429fffb865889ce3026940e471dd","observation_id":"08c63a93-2769-4044-b758-df2313d4dca4","resolution":{"observed_at":"2026-05-13T07:12:28.425885Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.23150/citation-record","integrity":"/paper/2505.23150/integrity","json":"/paper/2505.23150/citation-record.json","paper":"/paper/2505.23150"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T12:58:44.854747Z","title":"L., Almeida, D., Altenschmidt, J., Altman, S., Anadkat, S., et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-09T00:14:25.317749Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:44.854747Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:d2ac2bc7d73377003c3f3f5b01c9bd117c81d300349c9c96cab7b15d65d080d4","observation_id":"c403830a-7572-46f5-8a4c-4e8f99131eac","resolution":{"observed_at":"2026-08-07T12:58:44.854747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:44.967526Z","title":"Provable benefits of representational transfer in reinforcement learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-09T00:14:25.317749Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:44.967526Z"},"links":{"citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:418f048bda4142aafc8e5470e76f8683158d1617c86cad84e3939d9982ecedd3","observation_id":"80c9da86-63a7-4a64-b95f-3a0d48e2c8c8","resolution":{"observed_at":"2026-08-07T12:58:44.967526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:45.019350Z","title":"S., Courville, A., and Bellemare, M","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-09T00:14:25.317749Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:45.019350Z"},"links":{"citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:adbb05a5a608cc086e65f85e63ac1bda86d8fe5404328e98447ddcc96299b2ab","observation_id":"713717d6-e6bd-4c9d-96bd-c26975730a9d","resolution":{"observed_at":"2026-08-07T12:58:45.019350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:45.121469Z","title":"S., Courville, A","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-09T00:14:25.317749Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:45.121469Z"},"links":{"citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:fb7d3b026d7eb01adcb4b8b88f2273646ef98a581bc15bdb4f7700c896b9c2b9","observation_id":"97a075bd-184a-4409-aee0-3305870ecba4","resolution":{"observed_at":"2026-08-07T12:58:45.121469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:45.197775Z","title":"Hindsight experience replay.Advances in neural information processing systems, 30, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-09T00:14:25.317749Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:45.197775Z"},"links":{"citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:78ef02d69d4d4d847a76d405e84a03c74e1de4820f16db85898473a3587253c5","observation_id":"7da3fa4c-e85c-4342-99ec-4195f8b9d31f","resolution":{"observed_at":"2026-08-07T12:58:45.197775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:45.269538Z","title":"M., Baker, B., Chociej, M., Jozefowicz, R., McGrew, B., Pachocki, J., Petron, A., Plappert, M., Powell, G., Ray, A., et al","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-09T00:14:25.317749Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:45.269538Z"},"links":{"citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:7034a2305b84f70ec359565f1106eba0d497d306ac7ccbee882fdc8a991b5634","observation_id":"bf984bb8-9e57-4b9d-b244-bc6220398bcc","resolution":{"observed_at":"2026-08-07T12:58:45.269538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:45.345247Z","title":"Video pretraining (vpt): Learning to act by watching unlabeled online videos","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-09T00:14:25.317749Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:45.345247Z"},"links":{"citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:202731747cb7786ce665e478589827d01b44c400d3947152dd613de0a15181ed","observation_id":"74c0d758-659e-43e9-ab11-00f55115d6d5","resolution":{"observed_at":"2026-08-07T12:58:45.345247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:45.433639Z","title":"J., Smith, L., Kostrikov, I., and Levine, S","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-09T00:14:25.317749Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:45.433639Z"},"links":{"citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:7e2286b1f69250b2a1fbe27148521b46e2ba5db4c8b88f25918764fda57a9215","observation_id":"98169282-9aa4-4dae-8152-7ca68d2c59fc","resolution":{"observed_at":"2026-08-07T12:58:45.433639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:45.571178Z","title":"J., Schaul, T., van Hasselt, H","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-09T00:14:25.317749Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:45.571178Z"},"links":{"citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:f44bae38ea8236dcd4a622c6bd078e4221f04028dbf051bb29c470d503c4693b","observation_id":"3b1b6998-d6db-4859-ba31-625e5dc47236","resolution":{"observed_at":"2026-08-07T12:58:45.571178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:45.663223Z","title":"G., Naddaf, Y ., Veness, J., and Bowling, M","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-09T00:14:25.317749Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:45.663223Z"},"links":{"citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:9ded6851e20ea2b01d26e1201488465e9fb3d5154c47f90e0492e9ff1bf4a60e","observation_id":"d9949fcb-109c-4545-853c-02164a0e7727","resolution":{"observed_at":"2026-08-07T12:58:45.663223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:45.750044Z","title":"G., Dabney, W., and Munos, R","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-09T00:14:25.317749Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:45.750044Z"},"links":{"citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:2464256fdbf050468726498c7c3ed53f1a9d8016d681ae6ee80811a386c54145","observation_id":"c5f64815-4508-4e5a-ac03-e3cbf631d284","resolution":{"observed_at":"2026-08-07T12:58:45.750044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:45.804154Z","title":"Dynamic Programming","venue":null,"work_id":null,"year":1957},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-09T00:14:25.317749Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:45.804154Z"},"links":{"citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:1226d35364340c7efc22e3bc1316a99a2b79fa1e86978446dce3df403e4a2988","observation_id":"08d1053d-46cb-4f71-880d-78bc3dd62be7","resolution":{"observed_at":"2026-08-07T12:58:45.804154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:45.874874Z","title":null,"venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-09T00:14:25.317749Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:45.874874Z"},"links":{"citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:93b49677d13f0a9072ea6be484b9a10e08192a0931a9c8e032ee505335c7fccb","observation_id":"2486c5fb-c6b4-443c-8cdf-fd42dd633eb4","resolution":{"observed_at":"2026-08-07T12:58:45.874874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:45.968173Z","title":"P., and Weinberger, K","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-09T00:14:25.317749Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:45.968173Z"},"links":{"citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:63ba0add3e9f14933c2058c73a7f90aed56933582a4aecf7f7b2b54776b8263c","observation_id":"93b4fe42-9f73-4d76-82fa-1430bf502f95","resolution":{"observed_at":"2026-08-07T12:58:45.968173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:46.065866Z","title":"J., Leary, C., Maclaurin, D., Necula, G., Paszke, A., VanderPlas, J., Wanderman-Milne, S., et al","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-09T00:14:25.317749Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:46.065866Z"},"links":{"citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:eda1cceb14a00a11ce3bbc8ad150ff11b6e1782b37feeb01408bccc22aeac950","observation_id":"68d41d36-8aae-423b-996d-11f1b1fdfef7","resolution":{"observed_at":"2026-08-07T12:58:46.065866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06817","last_updated":"2023-08-11T17:45:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-12-13T18:55:15Z","title":"RT-1: Robotics Transformer for Real-World Control at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.06817","snapshot_observed_at":"2026-08-07T12:58:46.158225Z","title":"Rt-1: Robotics transformer for real-world control at scale","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-09T00:14:25.317749Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:46.158225Z"},"links":{"cited_paper":"/paper/2212.06817","citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:cc78c696924a8ae1ae75643384f0ac1f773230c13c03884fe6f5354bddca561f","observation_id":"63c3a67c-9aca-4c18-9056-0c246c26dc54","resolution":{"observed_at":"2026-08-07T12:58:46.158225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:46.274336Z","title":"D., Dhariwal, P., Neelakantan, A., Shyam, P., Sastry, G., Askell, A., et al","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-09T00:14:25.317749Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:46.274336Z"},"links":{"citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:502e6e7d9866862be005a19c7969a4fe213eee00f9d1d9b83a0253e0c29669a6","observation_id":"778f8cbc-d862-4bf3-b45f-d40d66689849","resolution":{"observed_at":"2026-08-07T12:58:46.274336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:46.379002Z","title":"Decision transformer: Reinforcement learning via sequence modeling","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-09T00:14:25.317749Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:46.379002Z"},"links":{"citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:4c4ff86da9e68b435d719fac4f729fbd51950553de4f794dfa256ceed3f3dc84","observation_id":"c8a57e69-4a22-4384-9865-e7bbadf3fcad","resolution":{"observed_at":"2026-08-07T12:58:46.379002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:46.445275Z","title":"A system for general in-hand object re-orientation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-09T00:14:25.317749Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:46.445275Z"},"links":{"citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:a21995e3580e0d8ab2aef1390d342098ffbe2743ee9ef8979c6ce598929c0d13","observation_id":"8bfdf1d4-ebbf-4fa2-969a-3b77060d52cf","resolution":{"observed_at":"2026-08-07T12:58:46.445275Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:46.566082Z","title":"Gradnorm: Gradient normaliza- tion for adaptive loss balancing in deep multitask networks","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-09T00:14:25.317749Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:46.566082Z"},"links":{"citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:45e4cc1b5478164a8caaba39f7c3f548e1dd1fca96ba2cdb6112a9b10dfe458a","observation_id":"5c71d3a6-7cbf-4467-85f6-f06c0eb2f829","resolution":{"observed_at":"2026-08-07T12:58:46.566082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:46.662012Z","title":"Just pick a sign: Optimizing deep multitask models with gradient sign dropout","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-09T00:14:25.317749Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:46.662012Z"},"links":{"citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:09248fc762cce12201eafef9132b48767399acd8034fbad6027171e07279c8f0","observation_id":"b133e83c-fc66-447e-8f32-286d8c5f2621","resolution":{"observed_at":"2026-08-07T12:58:46.662012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:46.707628Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-09T00:14:25.317749Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:46.707628Z"},"links":{"citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:0e2f8418154305563726bac8e398ceecb45cc73e8b9c86d2254dc4d7cbf56f3a","observation_id":"725d0859-c737-4840-9e5f-ba3f83d84306","resolution":{"observed_at":"2026-08-07T12:58:46.707628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:46.750339Z","title":"F., Leike, J., Brown, T., Martic, M., Legg, S., and Amodei, D","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-09T00:14:25.317749Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:46.750339Z"},"links":{"citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:81b0c0b32cac02355aa1aed38d48bfe3cb8acae244eaff923240406ed0b31117","observation_id":"e5752454-cbfc-4efa-9bae-76e8fa6c8afe","resolution":{"observed_at":"2026-08-07T12:58:46.750339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:46.835161Z","title":"Better exploration with optimistic actor critic","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-09T00:14:25.317749Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:46.835161Z"},"links":{"citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:8079783bfa64a9c7637e452d639a86cb4be437fa20b1e36652624f5861284f33","observation_id":"f173b2ca-f1b5-45e1-a98b-0ac0ff439627","resolution":{"observed_at":"2026-08-07T12:58:46.835161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:46.867259Z","title":"Magnetic control of tokamak plasmas through deep reinforcement learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-09T00:14:25.317749Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:46.867259Z"},"links":{"citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:b5c92f3b516ac70b7d90ac213fc59c0022273db734c33fd3e11ee6a6c3c25088","observation_id":"a9579dbe-bdc1-4982-8b39-ed18dca7ba0f","resolution":{"observed_at":"2026-08-07T12:58:46.867259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:46.915785Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-09T00:14:25.317749Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:46.915785Z"},"links":{"citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:8b7b7fb2227fb6d60c6f69f7ac93e1c9e2a605bb029ba0be0bf23e7a31d12d52","observation_id":"544c6b33-a6c6-45fd-ac93-60cd1d1f1f1d","resolution":{"observed_at":"2026-08-07T12:58:46.915785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:47.009204Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-09T00:14:25.317749Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:47.009204Z"},"links":{"citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:e0c995f9427b6e43505e9e6b6bf673f1ec47be1d5f339ce00efce9e0f7f3e3eb","observation_id":"cedc50c4-c18d-4625-9599-87af9b1a4611","resolution":{"observed_at":"2026-08-07T12:58:47.009204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:47.060172Z","title":"S., Lynch, C., Chowdhery, A., Ichter, B., Wahid, A., Tompson, J., Vuong, Q., Yu, T., et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-09T00:14:25.317749Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:47.060172Z"},"links":{"citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:480b26b9d0df196058515b54a64ee84664a81504f5c2fa53f920418094959b95","observation_id":"e88b3017-0087-4ffc-864a-353bd7bbd744","resolution":{"observed_at":"2026-08-07T12:58:47.060172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:47.128470Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-09T00:14:25.317749Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:47.128470Z"},"links":{"citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:a8d2867e42ed4211a57dcea87cb04437a6aabf5286ef07a903691337ce363dc8","observation_id":"8156fac5-839e-4306-9452-eb846bba34f8","resolution":{"observed_at":"2026-08-07T12:58:47.128470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:47.227015Z","title":"A., Chebotar, Y ., Xiao, T., Irpan, A., Levine, S., Castro, P","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-09T00:14:25.317749Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:47.227015Z"},"links":{"citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:0ccd86998ad19709ac1ce0e67f0a50c2a1b8193d4e7a48237e3b268e70b19b11","observation_id":"a990062a-6dba-4f00-b38e-c2f4518b63d4","resolution":{"observed_at":"2026-08-07T12:58:47.227015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:47.334044Z","title":"Model-agnostic meta-learning for fast adaptation of deep networks","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-09T00:14:25.317749Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:47.334044Z"},"links":{"citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:87e138985c6a57dc1cdd5be1c6b318973e721b509854194d13ebdd263a936a09","observation_id":"ba3cede9-4995-41b8-a536-f8b58699f1f3","resolution":{"observed_at":"2026-08-07T12:58:47.334044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:47.398149Z","title":"and Gu, S","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-09T00:14:25.317749Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:47.398149Z"},"links":{"citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:d899f16a80d0fb20161ec5c42fcb9293a416a9d3a3c7ceac6db0c06bb2783c1b","observation_id":"5e78924f-1e27-4136-9ecb-d46590b3ef89","resolution":{"observed_at":"2026-08-07T12:58:47.398149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:47.450522Z","title":"Addressing function approximation error in actor-critic methods","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-09T00:14:25.317749Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:47.450522Z"},"links":{"citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:95bb5536e6d25941ed9122c6a53f92dc0bd8f590979dbe5b65d97414c89552f8","observation_id":"b3f8af50-5032-4c35-8ef3-b0e167b5c22f","resolution":{"observed_at":"2026-08-07T12:58:47.450522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:47.514281Z","title":"S., Precup, D., and Meger, D","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-09T00:14:25.317749Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:47.514281Z"},"links":{"citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:f76da5c4d878b7acfe4b36ea33e1c3a07751ae3ede771cbe4744fe647b6f1a04","observation_id":"ad6cab91-fa5f-41a7-bd2b-995743cf13f6","resolution":{"observed_at":"2026-08-07T12:58:47.514281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:47.599219Z","title":"Divide-and-conquer reinforcement learning","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-09T00:14:25.317749Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:47.599219Z"},"links":{"citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:45cf73dfdf6f4de0ef942a380526b72366d100989d081de65d3d37aa0c05e578","observation_id":"3f5c7ad6-7ec2-46ff-b60d-2c762b03bdd6","resolution":{"observed_at":"2026-08-07T12:58:47.599219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:47.702018Z","title":"Soft actor-critic: Off-policy maximum entropy deep reinforcement learning with a stochastic actor","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-09T00:14:25.317749Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:47.702018Z"},"links":{"citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:c9ca8372cc496a39869c486270b6bd27882e472186dd58dc3bff59e656f01e90","observation_id":"11695065-eb2b-43bf-8acd-b1b64740f6bb","resolution":{"observed_at":"2026-08-07T12:58:47.702018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.04104","last_updated":"2024-04-17T17:41:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-01-10T18:12:16Z","title":"Mastering Diverse Domains through World Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.04104","snapshot_observed_at":"2026-08-07T12:58:47.810738Z","title":"Mastering diverse domains through world models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-09T00:14:25.317749Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:47.810738Z"},"links":{"cited_paper":"/paper/2301.04104","citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:80f5f1d312108078406727d3437d63ca3cbe77f496890893dcf93dd29710bc29","observation_id":"9b11e6db-448c-4902-ad8b-699cd749dc7e","resolution":{"observed_at":"2026-08-07T12:58:47.810738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.16828","last_updated":"2024-03-21T17:56:19Z","snapshot_observed_at":"2026-07-31T05:32:29.431480Z","submitted_at":"2023-10-25T17:57:07Z","title":"TD-MPC2: Scalable, Robust World Models for Continuous Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.16828","snapshot_observed_at":"2026-08-07T12:58:47.926005Z","title":"Td-mpc2: Scalable, robust world models for continuous control","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-09T00:14:25.317749Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:47.926005Z"},"links":{"cited_paper":"/paper/2310.16828","citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:46136f2a4728d845bce6bd50751cca0bdf9fc6498bede4c5a423d61bdf51547f","observation_id":"dcd824f7-6396-4ee8-87f5-7728212e1b21","resolution":{"observed_at":"2026-08-07T12:58:47.926005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:47.989117Z","title":"R., Millman, K","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-09T00:14:25.317749Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:47.989117Z"},"links":{"citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:ea1b43121e07f6f9d094c06718adc953e3536994c0b62c51dd5c0d9edf11e4c9","observation_id":"ee899869-f4ac-402a-bf1a-243769f12730","resolution":{"observed_at":"2026-08-07T12:58:47.989117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:48.058887Z","title":"T., Wang, Z., Heess, N., and Riedmiller, M","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-09T00:14:25.317749Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:48.058887Z"},"links":{"citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:aa9973e45e9de271ccba65775759f201e66c2db2a31c9e3ca9c907b2d067da9f","observation_id":"83679e9d-c067-4d62-96aa-c79d0a711e38","resolution":{"observed_at":"2026-08-07T12:58:48.058887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:48.115400Z","title":"Efficient multi-task reinforcement learning with cross-task policy guidance","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-09T00:14:25.317749Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:48.115400Z"},"links":{"citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:035cf6838c87019c134f760d2f896b5bb9cf6b78cd91cfb9e9963f97dee1f59b","observation_id":"0e9bb63e-08e0-494c-bd15-61e1e3d3a57a","resolution":{"observed_at":"2026-08-07T12:58:48.115400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.14701","last_updated":"2020-11-06T04:16:36Z","snapshot_observed_at":"2026-07-06T10:09:17.078776Z","submitted_at":"2020-10-28T02:17:24Z","title":"Scaling Laws for Autoregressive Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.14701","snapshot_observed_at":"2026-08-07T12:58:48.198228Z","title":"B., Dhariwal, P., Gray, S., et al","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-09T00:14:25.317749Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:48.198228Z"},"links":{"cited_paper":"/paper/2010.14701","citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:b7e2d2c27828b2b776ec434b7ec655962d5c82b7b84b9775fc06efa67f774f99","observation_id":"b8e672c4-b654-4d62-9126-c99e3324d0bc","resolution":{"observed_at":"2026-08-07T12:58:48.198228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:48.306053Z","title":"Multi-task deep reinforcement learning with popart","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-09T00:14:25.317749Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:48.306053Z"},"links":{"citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:e51538c4df93eed6c1ecdcd773bf849fce15121275d4d59738b0aa90ee01b34f","observation_id":"aa26013b-9414-44dd-8134-fb1b1af1cdd2","resolution":{"observed_at":"2026-08-07T12:58:48.306053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15556","last_updated":"2022-03-29T13:38:03Z","snapshot_observed_at":"2026-08-09T19:52:33.533277Z","submitted_at":"2022-03-29T13:38:03Z","title":"Training Compute-Optimal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.15556","snapshot_observed_at":"2026-08-07T12:58:48.423350Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-09T00:14:25.317749Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:48.423350Z"},"links":{"cited_paper":"/paper/2203.15556","citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:286340c93ca8bec6b1fcb3c9a8c238212c503fbc95a1b126b4fd295e8fd14868","observation_id":"e10abf86-0652-4874-9896-dc073ebdf597","resolution":{"observed_at":"2026-08-07T12:58:48.423350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:48.535699Z","title":"Otter: A vision-language-action model with text-aware visual feature extraction","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-09T00:14:25.317749Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:48.535699Z"},"links":{"citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:b7eb60583312625b26fe47a3b0be49a9f3b3cd692bfdf65485a1a77e1811d0d0","observation_id":"da2ff812-3cf0-4a19-a9f0-32166cf81636","resolution":{"observed_at":"2026-08-07T12:58:48.535699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.03062","last_updated":"2021-11-04T17:59:56Z","snapshot_observed_at":"2026-08-07T23:36:51.059335Z","submitted_at":"2021-11-04T17:59:56Z","title":"Generalization in Dexterous Manipulation via Geometry-Aware Multi-Task Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.03062","snapshot_observed_at":"2026-08-07T12:58:48.664444Z","title":"Generalization in dexterous manipulation via geometry-aware multi-task learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-09T00:14:25.317749Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:48.664444Z"},"links":{"cited_paper":"/paper/2111.03062","citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:0a5243301dd4b189c260914d7dc37193846b5cf113d05c3ebc29735ed5da6086","observation_id":"1d70b86f-53ea-46b7-86c0-9f050d402e4c","resolution":{"observed_at":"2026-08-07T12:58:48.664444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:48.794678Z","title":null,"venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-09T00:14:25.317749Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:48.794678Z"},"links":{"citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:f4291c217bad95896a062f8e9ca1eb9d97101203c81681578770aa133eea4bb6","observation_id":"433abc24-6485-4cf0-9535-847bfb6ac080","resolution":{"observed_at":"2026-08-07T12:58:48.794678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:06.429686Z","title":"H., Czechowski, K., Erhan, D., Finn, C., Kozakowski, P., Levine, S., et al","venue":null,"work_id":"640e257c-74e4-4c46-a6bc-ad7ec72ee56b","year":2019},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-09T00:14:25.317749Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:48.918826Z"},"links":{"citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:f7b1fe15881c632699285cf636fd8d6ed4e5128a8f07c70353fc4ae607bf0e01","observation_id":"1c78482a-fe9b-43f3-9780-a093bedcb51a","resolution":{"observed_at":"2026-08-07T12:59:06.510973Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-07-06T08:52:12.656082Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-07T12:58:49.042717Z","title":"B., Chess, B., Child, R., Gray, S., Radford, A., Wu, J., and Amodei, D","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-09T00:14:25.317749Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:49.042717Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:23ece5972a27e68f13fde4e13370e5a921c63f0f16335ac485af99131ffcb06c","observation_id":"a618c6a6-b9fc-42b8-81af-bfefb5440eaa","resolution":{"observed_at":"2026-08-07T12:58:49.042717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:06.281714Z","title":"Champion-level drone racing using deep reinforcement learning","venue":null,"work_id":"701a51be-ba4f-4a2d-94be-015fcf200886","year":2023},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-09T00:14:25.317749Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:49.165271Z"},"links":{"citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:426e36406743273e6674faaabcb783e4fd4c828a3a68e7f6aae91c62f6eaa0b5","observation_id":"5a2632db-b1fc-431f-b978-3e0be2c69394","resolution":{"observed_at":"2026-08-07T12:59:06.350502Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-07T12:58:49.306614Z","title":"J., Pertsch, K., Karamcheti, S., Xiao, T., Balakrishna, A., Nair, S., Rafailov, R., Foster, E., Lam, G., Sanketi, P., et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-09T00:14:25.317749Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:49.306614Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:f184f1ff090cb76a96f4644818aadcf17cbfff62cedd17c8cc8b9a2f8b949041","observation_id":"9dd9a88f-9958-4e08-a061-06a00151d3e1","resolution":{"observed_at":"2026-08-07T12:58:49.306614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:06.110084Z","title":"and Ba, J","venue":null,"work_id":"66da588d-d1a8-4f65-ab94-11db53d9d2c1","year":2015},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-09T00:14:25.317749Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:49.440203Z"},"links":{"citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:367b4e1b1e4cd54944c32b094ff2e984db7cb2be4babc7c69f05ad4ed2096d5c","observation_id":"82ba696b-a068-4fdc-942f-828e6bd8b89a","resolution":{"observed_at":"2026-08-07T12:59:06.176243Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:05.926602Z","title":"C., Lo, W.-Y ., et al","venue":null,"work_id":"316d7d77-21a0-4581-a6ff-05d44a619223","year":2023},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-09T00:14:25.317749Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:49.554910Z"},"links":{"citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:be8b4d74d64b8a241134eda550ce9db386e465843e8c40da4b6335b895649887","observation_id":"25391644-5245-47ae-a423-bd5dfe19e699","resolution":{"observed_at":"2026-08-07T12:59:06.005942Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:05.735044Z","title":null,"venue":null,"work_id":"3a7ea151-8ebd-4cf2-a35d-f0b56ff0c607","year":2000},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-09T00:14:25.317749Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:49.704891Z"},"links":{"citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:8b6b833eeea24b444f577d68586caeff6983af8b0cd47fb8e6e7a859493f2fae","observation_id":"dabe2b8f-9758-4483-88a5-a239cd795e92","resolution":{"observed_at":"2026-08-07T12:59:05.816415Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.13649","last_updated":"2021-03-07T16:37:37Z","snapshot_observed_at":"2026-08-09T00:13:45.533552Z","submitted_at":"2020-04-28T16:48:16Z","title":"Image Augmentation Is All You Need: Regularizing Deep Reinforcement Learning from Pixels","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.13649","snapshot_observed_at":"2026-08-07T12:58:49.816226Z","title":"Image augmentation is all you need: Regularizing deep reinforcement learning from pixels","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-09T00:14:25.317749Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:49.816226Z"},"links":{"cited_paper":"/paper/2004.13649","citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:20902ea5e7ea105d2032ffcf5ed47219c360248d51277c78689e0ab7f2976e7a","observation_id":"0b377d3d-6be3-4aa6-b19d-e7f2245a7783","resolution":{"observed_at":"2026-08-07T12:58:49.816226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.04716","last_updated":"2021-12-09T06:01:01Z","snapshot_observed_at":"2026-08-10T08:29:13.563397Z","submitted_at":"2021-12-09T06:01:01Z","title":"DR3: Value-Based Deep Reinforcement Learning Requires Explicit Regularization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.04716","snapshot_observed_at":"2026-08-07T12:58:49.941083Z","title":"DR3: Value- Based Deep Reinforcement Learning Requires Explicit Regularization","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-09T00:14:25.317749Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:49.941083Z"},"links":{"cited_paper":"/paper/2112.04716","citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:4171937cd60bbb628c9adf6d31c8c57b4e5c26d6cf5cdef4aa21015d7b20ba0c","observation_id":"e0fce54b-56f3-4e46-9d78-a750c2e7257d","resolution":{"observed_at":"2026-08-07T12:58:49.941083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.04034","last_updated":"2021-07-08T17:59:59Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-07-08T17:59:59Z","title":"RMA: Rapid Motor Adaptation for Legged Robots","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.04034","snapshot_observed_at":"2026-08-07T12:58:50.021389Z","title":"Rma: Rapid motor adaptation for legged robots","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-09T00:14:25.317749Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:50.021389Z"},"links":{"cited_paper":"/paper/2107.04034","citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:e9d3f5acccacf4001d2f2f9f983839bf7242d481ec7964f062ad21178445658d","observation_id":"b92fdb5d-b34e-42b9-9dd8-0b79474c4011","resolution":{"observed_at":"2026-08-07T12:58:50.021389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:05.542004Z","title":"Offline q-learning on diverse multi-task data both scales and generalizes","venue":null,"work_id":"776447ae-adb4-4954-aa80-f61202ad8190","year":2023},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-09T00:14:25.317749Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:50.084622Z"},"links":{"citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:4e6983270408764b23d5e8956d7a3d3169ad7f58d5e5487f1a5ccf4a59f968d0","observation_id":"b7b884ea-e9b5-4d08-8c9d-2d6a9dafe2a9","resolution":{"observed_at":"2026-08-07T12:59:05.630424Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:05.300940Z","title":"Reinforcement learning with augmented data","venue":null,"work_id":"3fedd4a0-b06e-4b69-82d3-81e0e8d19c54","year":2020},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-09T00:14:25.317749Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:50.148267Z"},"links":{"citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:6498ead2c65d65bac9064ad5fcc025daa3a121342307c9d745629e97a59ec217","observation_id":"e53f8be0-5c13-4972-8dd5-fe5ce4b48e33","resolution":{"observed_at":"2026-08-07T12:59:05.433016Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.09754","last_updated":"2025-05-29T15:02:38Z","snapshot_observed_at":"2026-08-10T03:59:03.902801Z","submitted_at":"2024-10-13T07:20:53Z","title":"SimBa: Simplicity Bias for Scaling Up Parameters in Deep Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.09754","snapshot_observed_at":"2026-08-07T12:58:50.224254Z","title":"J., Subramanian, K., Wurman, P","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-09T00:14:25.317749Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:50.224254Z"},"links":{"cited_paper":"/paper/2410.09754","citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:8861f9357f8bed11ec8913ca51cc26a897cff2f7dee820c26f46d2875e13daac","observation_id":"6e598f6e-02ff-41e2-80f0-7de53dca1f64","resolution":{"observed_at":"2026-08-07T12:58:50.224254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.15280","last_updated":"2025-05-29T14:58:32Z","snapshot_observed_at":"2026-08-10T06:30:44.145319Z","submitted_at":"2025-02-21T08:17:24Z","title":"Hyperspherical Normalization for Scalable Deep Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.15280","snapshot_observed_at":"2026-08-07T12:58:50.269251Z","title":"Hyperspherical normalization for scalable deep reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-09T00:14:25.317749Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:50.269251Z"},"links":{"cited_paper":"/paper/2502.15280","citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:6a99172ee717cf4f7faef8c629512c52828e0c37265e3ab8b9f026d5e5033457","observation_id":"0ac955de-f366-46dd-950e-f7f7e1d1f34f","resolution":{"observed_at":"2026-08-07T12:58:50.269251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:05.110477Z","title":"End-to-end training of deep visuomotor policies","venue":null,"work_id":"c47c2b73-99e7-4f29-96f8-1c6ac538b236","year":2016},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-09T00:14:25.317749Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:50.321875Z"},"links":{"citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:e71fbd4661b22aa643910aca79952d99989a69ef0ce7656f8c396b366122db27","observation_id":"ae14b0df-74e1-4d93-bc6c-6e594c8ee1ac","resolution":{"observed_at":"2026-08-07T12:59:05.163798Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-07T12:58:50.379474Z","title":"Deepseek-v3 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-09T00:14:25.317749Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:50.379474Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:9b130d4f06b47f80fce11ef7e1c45444262c4c8de5e5f6f8dcf0fb647291047d","observation_id":"ba682875-3697-4628-a572-3f871e74de31","resolution":{"observed_at":"2026-08-07T12:58:50.379474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:04.882735Z","title":"Conflict-averse gradient descent for multi-task learning","venue":null,"work_id":"36de019d-0db9-4352-9394-7228240284a5","year":2021},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-09T00:14:25.317749Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:50.436638Z"},"links":{"citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:45f7dce2a8dd7cbc3d819c70d5ac331e4198c945043ddb9f62e7a407cde313a0","observation_id":"391030fa-4064-41f5-a09d-32a19b9a97b0","resolution":{"observed_at":"2026-08-07T12:59:05.001905Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:04.609240Z","title":"Moka: Open-vocabulary robotic manipulation through mark-based visual prompting","venue":null,"work_id":"9ba3a4e0-ba70-47c8-ac78-7b5c5d584186","year":2024},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-09T00:14:25.317749Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:50.496763Z"},"links":{"citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:b8650b31141899146ef91291629decd92017e4bfc56497a38fb1dcd6dc425e5a","observation_id":"ff021dd4-6f61-420c-ad80-4985741505ef","resolution":{"observed_at":"2026-08-07T12:59:04.743852Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:04.385936Z","title":"Scaling laws for fine-grained mixture of experts","venue":null,"work_id":"bf081c12-257e-4888-8169-ef333c33668f","year":2024},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-09T00:14:25.317749Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:50.558081Z"},"links":{"citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:6dfd3bd80d2d340878524932d254001f932553b1faa6d1fc976dd4a27340fb2f","observation_id":"91825c01-af53-4a35-827c-03fa771c2fe6","resolution":{"observed_at":"2026-08-07T12:59:04.481489Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06685","last_updated":"2024-12-09T17:28:03Z","snapshot_observed_at":"2026-07-06T20:04:01.034597Z","submitted_at":"2024-12-09T17:28:03Z","title":"Policy Agnostic RL: Offline RL and Online RL Fine-Tuning of Any Class and Backbone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06685","snapshot_observed_at":"2026-08-07T12:58:50.612205Z","title":"S., Gao, T., Sampaio, G","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-09T00:14:25.317749Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:50.612205Z"},"links":{"cited_paper":"/paper/2412.06685","citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:6612bb7d5463439968b3619e77bd5caab1c580d44cddab22efd222a6cca99d37","observation_id":"a5446eea-762d-424c-bc91-e942572d7a78","resolution":{"observed_at":"2026-08-07T12:58:50.612205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.06162","last_updated":"2018-12-14T20:49:09Z","snapshot_observed_at":"2026-07-06T07:21:19.842962Z","submitted_at":"2018-12-14T20:49:09Z","title":"An Empirical Model of Large-Batch Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.06162","snapshot_observed_at":"2026-08-07T12:58:50.670391Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-09T00:14:25.317749Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:50.670391Z"},"links":{"cited_paper":"/paper/1812.06162","citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:ad6b7f310c058fd6f1a3d722d91639c8d26e761deeb1ce415df0f7ff58ffffbd","observation_id":"2a72955a-105a-4fd6-824e-1a6f81559308","resolution":{"observed_at":"2026-08-07T12:58:50.670391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:04.129530Z","title":"A., Veness, J., Bellemare, M","venue":null,"work_id":"de4652a7-a81c-4252-96ee-ea91726aa9fd","year":2015},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-09T00:14:25.317749Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:50.729363Z"},"links":{"citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:8ec283ebfe626421edb0c1ba9df2a05f536940cce6b39dfa3139018b8f7897e1","observation_id":"0add11d2-7c60-4e76-9f95-c193c5bd944f","resolution":{"observed_at":"2026-08-07T12:59:04.257681Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:03.885615Z","title":"P., Mirza, M., Graves, A., Lillicrap, T., Harley, T., Silver, D., and Kavukcuoglu, K","venue":null,"work_id":"ed14ab66-19ea-49f6-a34c-ac43d8a0ab90","year":1928},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-09T00:14:25.317749Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:50.786249Z"},"links":{"citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:b3cc25248c6b58888a532df3b8bc5bee358c955cb12b217b5645d85d7b65eb42","observation_id":"b5a37fcc-0fb6-4ddd-b758-ab4199734896","resolution":{"observed_at":"2026-08-07T12:59:03.997563Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:03.679659Z","title":"Tactical optimism and pessimism for deep reinforcement learning","venue":null,"work_id":"d501c947-2f7d-4722-9bce-be1b1ab093d6","year":2021},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-09T00:14:25.317749Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:50.835032Z"},"links":{"citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:aaa1dd1f8db6e905106667f5bb95217d1e7b313ab45f2071fa20d9dfe1cc8b55","observation_id":"abafc6a0-52de-4d8d-a1fa-c3a640fc15c7","resolution":{"observed_at":"2026-08-07T12:59:03.761137Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:03.460114Z","title":"and Cygan, M","venue":null,"work_id":"ea6a27cf-8bea-42a0-acc8-d6977340a6c8","year":2024},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-09T00:14:25.317749Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:50.913669Z"},"links":{"citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:045dddd10a5367f1b253caeffe8ca187da25f03e643a8085774fb6ea3e86cd6d","observation_id":"8f320d94-7ca4-4ed6-b067-77c05124fbfe","resolution":{"observed_at":"2026-08-07T12:59:03.545410Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.00514","last_updated":"2024-06-19T11:32:01Z","snapshot_observed_at":"2026-07-06T17:38:04.972649Z","submitted_at":"2024-03-01T13:25:10Z","title":"Overestimation, Overfitting, and Plasticity in Actor-Critic: the Bitter Lesson of Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.00514","snapshot_observed_at":"2026-08-07T12:58:51.075651Z","title":"Overestimation, overfitting, and plasticity in actor-critic: the bitter lesson of reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-09T00:14:25.317749Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:51.075651Z"},"links":{"cited_paper":"/paper/2403.00514","citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:97594d96f759d0886df0d4b70ba6fbbb5bca7ec9c5a308c28acaf9c7e1872a71","observation_id":"19548d37-4bec-43bc-af16-66f226479d82","resolution":{"observed_at":"2026-08-07T12:58:51.075651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16158","last_updated":"2024-12-03T08:42:49Z","snapshot_observed_at":"2026-08-07T12:11:17.938787Z","submitted_at":"2024-05-25T09:53:25Z","title":"Bigger, Regularized, Optimistic: scaling for compute and sample-efficient continuous control","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16158","snapshot_observed_at":"2026-08-07T12:58:51.287792Z","title":"Bigger, regularized, optimistic: scaling for compute and sample-efficient continuous control","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-09T00:14:25.317749Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:51.287792Z"},"links":{"cited_paper":"/paper/2405.16158","citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:01615144f0ea43314c9114cbd82aab5b5429e9d4c7e002068ec87f9cebff71f5","observation_id":"b79eba20-6d7e-4ddb-b599-54112b534780","resolution":{"observed_at":"2026-08-07T12:58:51.287792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:03.258850Z","title":"Dinov2: Learning robust visual features without supervision","venue":null,"work_id":"08f07840-0baa-4a01-ba5c-c5ef44d56f66","year":2024},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-09T00:14:25.317749Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:51.408062Z"},"links":{"citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:7e367dfcdbb7451a5516b3a13257fe89399d12613594b4bbf2a08d300c3ffa4f","observation_id":"cc34fa6c-1f32-40c8-b836-35a24ae65bc6","resolution":{"observed_at":"2026-08-07T12:59:03.335629Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:51.565324Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-09T00:14:25.317749Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:51.565324Z"},"links":{"citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:02149cfd6e3bcb0392bf0b251a9016230a07f1271a4adea2446afea248f7e9e6","observation_id":"08140eb0-776a-4c7a-be59-1307dba4a575","resolution":{"observed_at":"2026-08-07T12:58:51.565324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1511.06342","last_updated":"2016-02-22T19:59:40Z","snapshot_observed_at":"2026-08-02T01:15:11.394264Z","submitted_at":"2015-11-19T20:17:27Z","title":"Actor-Mimic: Deep Multitask and Transfer Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1511.06342","snapshot_observed_at":"2026-08-07T12:58:51.719632Z","title":"L., and Salakhutdinov, R","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-09T00:14:25.317749Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:51.719632Z"},"links":{"cited_paper":"/paper/1511.06342","citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:b4c6db7911e33c626d1c782ed567476e7f009d6d620d4003285b44166b151055","observation_id":"3bba43ec-1eaa-4744-9ece-92d7769e9d23","resolution":{"observed_at":"2026-08-07T12:58:51.719632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09329","last_updated":"2024-10-28T23:33:19Z","snapshot_observed_at":"2026-08-10T00:32:45.181466Z","submitted_at":"2024-06-13T17:07:49Z","title":"Is Value Learning Really the Main Bottleneck in Offline RL?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09329","snapshot_observed_at":"2026-08-07T12:58:51.847608Z","title":"Is value learning really the main bottleneck in offline rl? arXiv preprint arXiv:2406.09329, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-09T00:14:25.317749Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:51.847608Z"},"links":{"cited_paper":"/paper/2406.09329","citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:754d97720743cbe3e4ee213a93e6e48bad33782cca376a46164d1ff1e2b024cc","observation_id":"d4eaee66-7207-4e20-a551-212ec8395e2c","resolution":{"observed_at":"2026-08-07T12:58:51.847608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02538","last_updated":"2025-05-25T22:15:41Z","snapshot_observed_at":"2026-08-09T11:47:17.453701Z","submitted_at":"2025-02-04T18:04:05Z","title":"Flow Q-Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.02538","snapshot_observed_at":"2026-08-07T12:58:51.955281Z","title":"Flow q-learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-09T00:14:25.317749Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:51.955281Z"},"links":{"cited_paper":"/paper/2502.02538","citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:38a2230389a083aba6736232f6cabac2dfea536a85f7beb05b85efd29c736112","observation_id":"f4dbe154-c0a7-4194-aec4-404adbed9de7","resolution":{"observed_at":"2026-08-07T12:58:51.955281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:52.070645Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-09T00:14:25.317749Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:52.070645Z"},"links":{"citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:1c3b1ea0181580c9d960e10a2e0f4ffad934bd61454d2a32d398a60664e803ea","observation_id":"8b01f985-6863-4184-b4fd-d48391dbff62","resolution":{"observed_at":"2026-08-07T12:58:52.070645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:03.020045Z","title":"W., Hallacy, C., Ramesh, A., Goh, G., Agarwal, S., Sastry, G., Askell, A., Mishkin, P., Clark, J., et al","venue":null,"work_id":"aac2e264-218b-46ff-b483-ddda1d175cfd","year":2021},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-09T00:14:25.317749Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:52.157484Z"},"links":{"citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:343270c16a1bfaca8a910379db5d50d64142546c10a309d23a419ca50cb6ede5","observation_id":"5c9ea69e-97fa-4277-973e-b05b52d26d1f","resolution":{"observed_at":"2026-08-07T12:59:03.113363Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:02.814595Z","title":"Efficient off-policy meta- reinforcement learning via probabilistic context variables","venue":null,"work_id":"bd6d9c11-36a4-44c3-b4ef-4b39ad269cd2","year":2019},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-09T00:14:25.317749Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:52.275833Z"},"links":{"citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:c9fcc1cfffbf0d268fe50f974e351c621ea6c6492f3c4f89c60df73adc72101d","observation_id":"1f3c6d5b-3fbd-431d-b5ed-0507340cfac5","resolution":{"observed_at":"2026-08-07T12:59:02.900845Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.06175","last_updated":"2022-11-11T10:04:29Z","snapshot_observed_at":"2026-08-08T03:18:33.595658Z","submitted_at":"2022-05-12T16:03:26Z","title":"A Generalist Agent","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.06175","snapshot_observed_at":"2026-08-07T12:58:52.357891Z","title":"G., Novikov, A., Barth-Maron, G., Gimenez, M., Sulsky, Y ., Kay, J., Springenberg, J","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-09T00:14:25.317749Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:52.357891Z"},"links":{"cited_paper":"/paper/2205.06175","citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:e295a5789818476ed787cebc430a250b6cbf17670c100e2647db5756dbd7912a","observation_id":"0935f476-d90e-4a90-ab89-f9845ff239e6","resolution":{"observed_at":"2026-08-07T12:58:52.357891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1511.06295","last_updated":"2016-01-07T18:43:03Z","snapshot_observed_at":"2026-07-06T04:37:06.738855Z","submitted_at":"2015-11-19T18:38:47Z","title":"Policy Distillation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1511.06295","snapshot_observed_at":"2026-08-07T12:58:52.473229Z","title":"A., Colmenarejo, S","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-09T00:14:25.317749Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:52.473229Z"},"links":{"cited_paper":"/paper/1511.06295","citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:d30b3fdb2dac8df991661de9674fbb9e97ddc75b711c6f3cfc7ccad7becb2285","observation_id":"fe4849cb-8398-425d-b46a-d6a609b6f0a4","resolution":{"observed_at":"2026-08-07T12:58:52.473229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04327","last_updated":"2025-07-25T01:10:02Z","snapshot_observed_at":"2026-08-08T22:40:54.869290Z","submitted_at":"2025-02-06T18:59:47Z","title":"Value-Based Deep RL Scales Predictably","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04327","snapshot_observed_at":"2026-08-07T12:58:52.599976Z","title":"Value-based deep rl scales predictably","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-09T00:14:25.317749Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:52.599976Z"},"links":{"cited_paper":"/paper/2502.04327","citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:4fbb26a76069ca823bf06f9a876764b51aeca4d9dd018a59d288da5c70987e40","observation_id":"c54498a5-69f8-4676-9eeb-e9dc48e64daa","resolution":{"observed_at":"2026-08-07T12:58:52.599976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:02.581156Z","title":"D., Courville, A., and Bachman, P","venue":null,"work_id":"d3636655-68ce-402c-8104-4d6dcbbfc87a","year":2020},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-09T00:14:25.317749Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:52.687060Z"},"links":{"citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:2be2a038169ab98040ef87f9621b9f15b09b5871250ab77238bbbe218ea10591","observation_id":"312c1e26-ea4e-4218-b376-37e15e0b2dfc","resolution":{"observed_at":"2026-08-07T12:59:02.700604Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:02.333447Z","title":null,"venue":null,"work_id":"dc077be4-5a64-4ec4-82f7-a0f380abd1c7","year":2023},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-09T00:14:25.317749Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:52.799338Z"},"links":{"citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:c4bfa2568f68fe3631e3f20697f019f2ead31a763792919b4ba0b39e8132f767","observation_id":"2bf15b1f-6df2-48bb-9ed5-19c29a58c920","resolution":{"observed_at":"2026-08-07T12:59:02.436833Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:02.076431Z","title":"and Koltun, V","venue":null,"work_id":"72149335-f50c-4e36-9971-bb6f053691bd","year":2018},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-09T00:14:25.317749Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:52.948108Z"},"links":{"citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:32c22182e08c84218a08c66bb37bdf4d84b35df59cab6066820d3ffca2c6addd","observation_id":"980db95b-203d-45db-9dc7-f0f6d759858c","resolution":{"observed_at":"2026-08-07T12:59:02.224585Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.10506","last_updated":"2024-06-18T18:11:07Z","snapshot_observed_at":"2026-08-04T05:16:12.953751Z","submitted_at":"2024-03-15T17:45:44Z","title":"HumanoidBench: Simulated Humanoid Benchmark for Whole-Body Locomotion and Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.10506","snapshot_observed_at":"2026-08-07T12:58:53.082154Z","title":"Humanoidbench: Simu- lated humanoid benchmark for whole-body locomotion and manipulation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-09T00:14:25.317749Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:53.082154Z"},"links":{"cited_paper":"/paper/2403.10506","citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:795a8768a1bd3740546a30d1f4e97b9a5ddab2e0563a5b547e2cf8575b35775f","observation_id":"26518396-25da-4193-9b3b-c8c1a5ad8717","resolution":{"observed_at":"2026-08-07T12:58:53.082154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:01.774639Z","title":null,"venue":null,"work_id":"5f53017d-f8c1-4808-9c8a-c0b8d92f653a","year":1953},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-09T00:14:25.317749Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:53.239036Z"},"links":{"citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:ee1413978dfdfa024d49897fd74da77e82ae4ffb9ce9cb4ffd72c068f4f972d2","observation_id":"2d99e650-1b44-4599-ae47-53f38f3ab586","resolution":{"observed_at":"2026-08-07T12:59:01.908957Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:01.443620Z","title":"Deterministic policy gradient algorithms","venue":null,"work_id":"266345a3-624f-4e53-83f4-8e20a705aa81","year":2014},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-09T00:14:25.317749Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:53.386932Z"},"links":{"citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:761c808953ad393c5fcca55c2224c8cc89be74c5cbaa8ae4b1aad6a0d8d8f8f5","observation_id":"d63ad454-a067-4c4b-8a9c-4c038b1d35fd","resolution":{"observed_at":"2026-08-07T12:59:01.644985Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:53.487874Z","title":"Mastering the game of go without human knowledge","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-09T00:14:25.317749Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:53.487874Z"},"links":{"citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:f63c7c1d6007ca39d4c973867a12296d76d49c929dfe11f2c5768f1108c61127","observation_id":"6390f0ca-ea85-4fef-9b4a-b50d88db26b9","resolution":{"observed_at":"2026-08-07T12:58:53.487874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:01.134423Z","title":"Multi-task reinforcement learning with context-based representations","venue":null,"work_id":"7b88aee2-349b-48c6-b25d-529eb5813bd2","year":2021},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-09T00:14:25.317749Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:53.631167Z"},"links":{"citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:726abb7ac0ee425cfceb5e7214ecddb9e9999ef3e841b3bb5f13d44d79365a6f","observation_id":"efe21a7b-af83-4aea-b805-06006d46249a","resolution":{"observed_at":"2026-08-07T12:59:01.310812Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:00.817060Z","title":"T., Abdolmaleki, A., Zhang, J., Groth, O., Bloesch, M., Lampe, T., Brakel, P., Bechtle, S","venue":null,"work_id":"64b33252-50d0-4765-bf3b-e1da76633dbe","year":2024},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-09T00:14:25.317749Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:53.780565Z"},"links":{"citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:a4c72a275af56aad726c2685010c32027960ee94d72b0c7efa395fa70d682401","observation_id":"c9aa705f-9b4b-44d3-a5c5-4b0ef5788f1a","resolution":{"observed_at":"2026-08-07T12:59:00.982770Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:00.563658Z","title":"Paco: Parameter-compositional multi-task reinforcement learning","venue":null,"work_id":"a1a79568-c6d9-431f-b7f8-0da5e2bc8adc","year":2022},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-09T00:14:25.317749Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:53.893424Z"},"links":{"citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:0b9160da9870f4f1d43306b44e3e4f4d7e7edd24f9eb1b5704e5346a35607d5e","observation_id":"517bebf6-d433-4734-b018-4b8d1cc626b7","resolution":{"observed_at":"2026-08-07T12:59:00.682511Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:54.004334Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-09T00:14:25.317749Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:54.004334Z"},"links":{"citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:a67a7c0fd83771766453a9e591ee040a064581ed1cb05549a20ed972c7792670","observation_id":"3638475a-9732-4c67-a418-49cf4febf075","resolution":{"observed_at":"2026-08-07T12:58:54.004334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-01T20:24:08.300098Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.00690","snapshot_observed_at":"2026-08-07T12:58:54.169006Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-09T00:14:25.317749Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:54.169006Z"},"links":{"cited_paper":"/paper/1801.00690","citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:f25ff019a8833359d3b62c64d75614d38d8e7ae94c5b6c761886a20ed5c69b3d","observation_id":"f4797f4a-225b-42be-bab4-c83fa7fde7b1","resolution":{"observed_at":"2026-08-07T12:58:54.169006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-07T12:58:54.270164Z","title":"M., Hauth, A., Millican, K., et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-09T00:14:25.317749Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:54.270164Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:81a525eea55a7bb69ee71a2a94f1cb834b3550347f98e17972b4e9d9898b240a","observation_id":"9ad56e27-cc51-49c5-973b-9397858f3258","resolution":{"observed_at":"2026-08-07T12:58:54.270164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12213","last_updated":"2024-05-26T19:55:26Z","snapshot_observed_at":"2026-07-06T18:16:51.116432Z","submitted_at":"2024-05-20T17:57:01Z","title":"Octo: An Open-Source Generalist Robot Policy","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.12213","snapshot_observed_at":"2026-08-07T12:58:54.408075Z","title":"M., Ghosh, D., Walke, H., Pertsch, K., Black, K., Mees, O., Dasari, S., Hejna, J., Kreiman, T., Xu, C., et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-09T00:14:25.317749Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:54.408075Z"},"links":{"cited_paper":"/paper/2405.12213","citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:70b8bd40049f79ca0de9f9cadbefb7d6ef0536b0cfb310d2193b1d2ebaf7abf3","observation_id":"13c97a2e-7c15-4072-ada9-4c0f675e3410","resolution":{"observed_at":"2026-08-07T12:58:54.408075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:00.248000Z","title":"M., Quan, J., Kirkpatrick, J., Hadsell, R., Heess, N., and Pascanu, R","venue":null,"work_id":"cc577163-cc36-4c41-9faf-e5286e99bb02","year":2017},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-09T00:14:25.317749Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:54.542081Z"},"links":{"citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:051f01e59aedfd81a5ebe4225ad40331f5f97143dce23fec1d8a51042b3fab9e","observation_id":"4abc9372-2b55-4050-b912-923702c19438","resolution":{"observed_at":"2026-08-07T12:59:00.375399Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T00:14:25.317749Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":76,"verified_exact":0,"verified_fuzzy":23},"total_outbound_references":118},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 100 of 118 outbound references and 9 inbound Pith citation observations for arXiv:2505.23150."}