{"as_of":"2026-08-19T09:49:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3d0eede0f5374870dc8081e5b1d87cad431af4be52c6e82adac904f95cee2eb9","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":18,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":18,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":18,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":18,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T21:45:57.537078Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T21:57:25.915173Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"1912.02877","last_updated":"2021-09-03T22:15:10Z","snapshot_observed_at":"2026-08-07T04:02:10.973662Z","submitted_at":"2019-12-05T21:13:36Z","title":"Training Agents using Upside-Down Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"1912.02877","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1912.02877","snapshot_observed_at":"2026-07-02T21:57:25.915173Z","title":"Training agents using upside-down reinforcement learning","venue":null,"work_id":"56a8b123-20b1-4269-a9b7-e11faaab37e7","year":1912},"citing_paper":{"arxiv_id":"2106.01345","last_updated":"2021-06-24T17:09:59Z","snapshot_observed_at":"2026-08-14T21:45:36.706364Z","submitted_at":"2021-06-02T17:53:39Z","title":"Decision Transformer: Reinforcement Learning via Sequence Modeling","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-18T15:11:11.056013Z"},"links":{"cited_paper":"/paper/1912.02877","citing_paper":"/paper/2106.01345"},"observation_digest":"sha256:b7af711f14854d2db5790ce5486c2e2a0fd8df653e8936952af5f8de2a0f5b02","observation_id":"80bf680b-5b57-4d18-8841-ae1b5076cacc","resolution":{"observed_at":"2026-05-18T15:11:11.117837Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.02877","last_updated":"2021-09-03T22:15:10Z","snapshot_observed_at":"2026-08-07T04:02:10.973662Z","submitted_at":"2019-12-05T21:13:36Z","title":"Training Agents using Upside-Down Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"1912.02877","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1912.02877","snapshot_observed_at":"2026-07-02T21:57:25.915173Z","title":"Training agents using upside-down reinforcement learning","venue":null,"work_id":"56a8b123-20b1-4269-a9b7-e11faaab37e7","year":1912},"citing_paper":{"arxiv_id":"2211.15657","last_updated":"2023-07-10T07:25:26Z","snapshot_observed_at":"2026-08-14T18:28:45.696263Z","submitted_at":"2022-11-28T18:59:02Z","title":"Is Conditional Generative Modeling all you need for Decision-Making?","version":4},"reference_index":209,"source":"arxiv_source","source_observed_at":"2026-05-15T15:35:10.593969Z"},"links":{"cited_paper":"/paper/1912.02877","citing_paper":"/paper/2211.15657"},"observation_digest":"sha256:2df034f1d8e1b567ace9258dbc9b05c06c0a3ffc65a5e0050e999f6312e2fc62","observation_id":"1baf92be-02ec-4bbb-be46-cfa2500d5d2e","resolution":{"observed_at":"2026-05-15T15:35:10.858704Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.02877","last_updated":"2021-09-03T22:15:10Z","snapshot_observed_at":"2026-08-07T04:02:10.973662Z","submitted_at":"2019-12-05T21:13:36Z","title":"Training Agents using Upside-Down Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"1912.02877","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1912.02877","snapshot_observed_at":"2026-07-02T21:57:25.915173Z","title":"Training agents using upside-down reinforcement learning","venue":null,"work_id":"56a8b123-20b1-4269-a9b7-e11faaab37e7","year":1912},"citing_paper":{"arxiv_id":"2308.00352","last_updated":"2024-11-01T14:36:52Z","snapshot_observed_at":"2026-08-12T16:02:21.969968Z","submitted_at":"2023-08-01T07:49:10Z","title":"MetaGPT: Meta Programming for A Multi-Agent Collaborative Framework","version":7},"reference_index":150,"source":"arxiv_source","source_observed_at":"2026-05-11T03:43:18.632292Z"},"links":{"cited_paper":"/paper/1912.02877","citing_paper":"/paper/2308.00352"},"observation_digest":"sha256:f8645f968a99647022a988c640aa681ec1cd9299cb14124b4b7a22cf4482e319","observation_id":"38f45699-690a-442d-9483-3fb582ba6590","resolution":{"observed_at":"2026-05-11T03:43:19.125664Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.02877","last_updated":"2021-09-03T22:15:10Z","snapshot_observed_at":"2026-08-07T04:02:10.973662Z","submitted_at":"2019-12-05T21:13:36Z","title":"Training Agents using Upside-Down Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.02877","snapshot_observed_at":"2026-08-12T18:35:59.778062Z","title":"K., Shyam, P., Mutz, F., Ja \\'s kowski, W., and Schmidhuber, J","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.11457","last_updated":"2024-11-18T10:44:20Z","snapshot_observed_at":"2026-08-17T09:25:13.586799Z","submitted_at":"2024-11-18T10:44:20Z","title":"Upside-Down Reinforcement Learning for More Interpretable Optimal Control","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-12T18:35:59.778062Z"},"links":{"cited_paper":"/paper/1912.02877","citing_paper":"/paper/2411.11457"},"observation_digest":"sha256:78b04ab5995f236005b432cec3fb7f0a5cd09c4ce13e874326f4fb51429511b4","observation_id":"0ff21285-d901-4b47-901b-4138ce934c81","resolution":{"observed_at":"2026-08-12T18:35:59.778062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.02877","last_updated":"2021-09-03T22:15:10Z","snapshot_observed_at":"2026-08-07T04:02:10.973662Z","submitted_at":"2019-12-05T21:13:36Z","title":"Training Agents using Upside-Down Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.02877","snapshot_observed_at":"2026-08-12T16:32:34.761175Z","title":"Training agents using upside-down reinforcement learning, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.13420","last_updated":"2024-11-20T16:06:28Z","snapshot_observed_at":"2026-08-16T11:54:54.803696Z","submitted_at":"2024-11-20T16:06:28Z","title":"Heuristically Adaptive Diffusion-Model Evolutionary Strategy","version":1},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-08-12T16:32:34.761175Z"},"links":{"cited_paper":"/paper/1912.02877","citing_paper":"/paper/2411.13420"},"observation_digest":"sha256:533e1166a2882926ec9b67076d7b1f022f1ac6973c9c53c031e3846260739acb","observation_id":"9bd1bbdf-79b5-440e-9209-b86158fa4055","resolution":{"observed_at":"2026-08-12T16:32:34.761175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.02877","last_updated":"2021-09-03T22:15:10Z","snapshot_observed_at":"2026-08-07T04:02:10.973662Z","submitted_at":"2019-12-05T21:13:36Z","title":"Training Agents using Upside-Down Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.02877","snapshot_observed_at":"2026-08-11T22:10:22.971826Z","title":null,"venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2412.03782","last_updated":"2025-06-05T17:58:57Z","snapshot_observed_at":"2026-08-17T22:33:49.443304Z","submitted_at":"2024-12-05T00:05:11Z","title":"The broader spectrum of in-context learning","version":3},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-11T22:10:22.971826Z"},"links":{"cited_paper":"/paper/1912.02877","citing_paper":"/paper/2412.03782"},"observation_digest":"sha256:ac5c2b997e27274b24c48bb9f871f0f87c7135f4e7efb723b912455beac65ec8","observation_id":"30b68d5f-2cf3-4bf6-9ce7-1411877a6585","resolution":{"observed_at":"2026-08-11T22:10:22.971826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.02877","last_updated":"2021-09-03T22:15:10Z","snapshot_observed_at":"2026-08-07T04:02:10.973662Z","submitted_at":"2019-12-05T21:13:36Z","title":"Training Agents using Upside-Down Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.02877","snapshot_observed_at":"2026-08-11T15:02:44.262016Z","title":"K.; Shyam, P.; Mutz, F.; Ja \\'s kowski, W.; and Schmidhuber, J","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.11410","last_updated":"2024-12-20T11:46:05Z","snapshot_observed_at":"2026-08-16T12:47:33.118030Z","submitted_at":"2024-12-16T03:25:28Z","title":"MGDA: Model-based Goal Data Augmentation for Offline Goal-conditioned Weighted Supervised Learning","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-11T15:02:44.262016Z"},"links":{"cited_paper":"/paper/1912.02877","citing_paper":"/paper/2412.11410"},"observation_digest":"sha256:99a3913a638d2a7495f7b5adbc541f0e2825580828d1b38f889edfcb4871aac2","observation_id":"bb27b557-e7ef-4f33-b183-0d538c203ee5","resolution":{"observed_at":"2026-08-11T15:02:44.262016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.02877","last_updated":"2021-09-03T22:15:10Z","snapshot_observed_at":"2026-08-07T04:02:10.973662Z","submitted_at":"2019-12-05T21:13:36Z","title":"Training Agents using Upside-Down Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.02877","snapshot_observed_at":"2026-08-15T21:45:57.537078Z","title":"Training agents using upside-down reinforcement learning.arXiv preprint arXiv:1912.02877, 2019","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2505.09114","last_updated":"2025-05-14T03:45:16Z","snapshot_observed_at":"2026-08-18T15:59:47.887758Z","submitted_at":"2025-05-14T03:45:16Z","title":"Beyond the Known: Decision Making with Counterfactual Reasoning Decision Transformer","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T21:45:57.537078Z"},"links":{"cited_paper":"/paper/1912.02877","citing_paper":"/paper/2505.09114"},"observation_digest":"sha256:8b82e6c40810bb5b7e4091f7596e8a042607b84e08e34d8e564244ce6a26a24d","observation_id":"788f03c6-d461-45cc-a387-7cfd7518c8fc","resolution":{"observed_at":"2026-08-15T21:45:57.537078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.02877","last_updated":"2021-09-03T22:15:10Z","snapshot_observed_at":"2026-08-07T04:02:10.973662Z","submitted_at":"2019-12-05T21:13:36Z","title":"Training Agents using Upside-Down Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.02877","snapshot_observed_at":"2026-08-07T13:30:24.270417Z","title":null,"venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2505.21852","last_updated":"2025-05-28T00:48:20Z","snapshot_observed_at":"2026-08-11T12:09:13.722112Z","submitted_at":"2025-05-28T00:48:20Z","title":"A Provable Approach for End-to-End Safe Reinforcement Learning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:24.270417Z"},"links":{"cited_paper":"/paper/1912.02877","citing_paper":"/paper/2505.21852"},"observation_digest":"sha256:bedd098b62c28e0d5eacbe9b4e7e95339ae9c9827fb801a4736489d668a04a4d","observation_id":"fc5c38cc-235b-47fc-a44a-eabe153027c2","resolution":{"observed_at":"2026-08-07T13:30:24.270417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.02877","last_updated":"2021-09-03T22:15:10Z","snapshot_observed_at":"2026-08-07T04:02:10.973662Z","submitted_at":"2019-12-05T21:13:36Z","title":"Training Agents using Upside-Down Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.02877","snapshot_observed_at":"2026-08-07T05:19:08.014844Z","title":"Training agents using upside-down reinforcement learning.arXiv preprint arXiv:1912.02877, 2019","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2506.08463","last_updated":"2025-06-10T05:37:51Z","snapshot_observed_at":"2026-08-19T07:27:50.595165Z","submitted_at":"2025-06-10T05:37:51Z","title":"How to Provably Improve Return Conditioned Supervised Learning?","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:08.014844Z"},"links":{"cited_paper":"/paper/1912.02877","citing_paper":"/paper/2506.08463"},"observation_digest":"sha256:cd7c9f047eae457a3b9666f7fa7472fc69163f44f62093bf7dff1bd401e08f5c","observation_id":"1e69c1d7-7926-44ab-b3ac-bb44ef679d6c","resolution":{"observed_at":"2026-08-07T05:19:08.014844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.02877","last_updated":"2021-09-03T22:15:10Z","snapshot_observed_at":"2026-08-07T04:02:10.973662Z","submitted_at":"2019-12-05T21:13:36Z","title":"Training Agents using Upside-Down Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.02877","snapshot_observed_at":"2026-08-06T18:15:46.817188Z","title":"K., Shyam, P., Mutz, F., Ja´skowski, W., and Schmidhuber, J","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2507.09041","last_updated":"2025-07-11T21:36:19Z","snapshot_observed_at":"2026-08-09T05:31:23.348356Z","submitted_at":"2025-07-11T21:36:19Z","title":"Behavioral Exploration: Learning to Explore via In-Context Adaptation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T18:15:46.817188Z"},"links":{"cited_paper":"/paper/1912.02877","citing_paper":"/paper/2507.09041"},"observation_digest":"sha256:98e4e801adfe43130cc4d910273614aa387a684b06ed123b89ff39549919f3f9","observation_id":"325a3a7e-8201-4ff1-971f-797eabf7a0e8","resolution":{"observed_at":"2026-08-06T18:15:46.817188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.02877","last_updated":"2021-09-03T22:15:10Z","snapshot_observed_at":"2026-08-07T04:02:10.973662Z","submitted_at":"2019-12-05T21:13:36Z","title":"Training Agents using Upside-Down Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.02877","snapshot_observed_at":"2026-08-06T15:26:24.543536Z","title":null,"venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2507.16139","last_updated":"2025-07-22T01:13:45Z","snapshot_observed_at":"2026-08-15T09:57:16.575071Z","submitted_at":"2025-07-22T01:13:45Z","title":"Equivariant Goal Conditioned Contrastive Reinforcement Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T15:26:24.543536Z"},"links":{"cited_paper":"/paper/1912.02877","citing_paper":"/paper/2507.16139"},"observation_digest":"sha256:1608fe37826c7ca69e71cd37e64ea56c31abdb39c6f1667a0f2a169b799ee953","observation_id":"715459ac-bfe6-476e-b793-aea24c7a4984","resolution":{"observed_at":"2026-08-06T15:26:24.543536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.02877","last_updated":"2021-09-03T22:15:10Z","snapshot_observed_at":"2026-08-07T04:02:10.973662Z","submitted_at":"2019-12-05T21:13:36Z","title":"Training Agents using Upside-Down Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.02877","snapshot_observed_at":"2026-08-06T10:27:14.448302Z","title":"Training agents using upside-down reinforcement learning","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2508.00152","last_updated":"2025-07-31T20:23:25Z","snapshot_observed_at":"2026-08-16T23:30:57.353231Z","submitted_at":"2025-07-31T20:23:25Z","title":"GeoExplorer: Active Geo-localization with Curiosity-Driven Exploration","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-06T10:27:14.448302Z"},"links":{"cited_paper":"/paper/1912.02877","citing_paper":"/paper/2508.00152"},"observation_digest":"sha256:1384f8935e3dfef28e4029b711c7e7d457d3960ea863ca5b3e9145b39bea4750","observation_id":"28fa6eef-fb21-4a98-897d-7278f3b6ea36","resolution":{"observed_at":"2026-08-06T10:27:14.448302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.02877","last_updated":"2021-09-03T22:15:10Z","snapshot_observed_at":"2026-08-07T04:02:10.973662Z","submitted_at":"2019-12-05T21:13:36Z","title":"Training Agents using Upside-Down Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.02877","snapshot_observed_at":"2026-08-03T08:14:02.544642Z","title":null,"venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2601.18175","last_updated":"2026-06-02T19:09:34Z","snapshot_observed_at":"2026-08-09T12:19:31.761417Z","submitted_at":"2026-01-26T05:54:39Z","title":"Success Conditioning as Policy Improvement: The Optimization Problem Solved by Imitating Success","version":2},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-03T08:14:02.544642Z"},"links":{"cited_paper":"/paper/1912.02877","citing_paper":"/paper/2601.18175"},"observation_digest":"sha256:abaf0132b2103db6ee9380624c5999ba70335ab543c1fa4e07257cbb909cf281","observation_id":"310d9c01-bbdb-4460-8592-6e9a51c52323","resolution":{"observed_at":"2026-08-03T08:14:02.544642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.02877","last_updated":"2021-09-03T22:15:10Z","snapshot_observed_at":"2026-08-07T04:02:10.973662Z","submitted_at":"2019-12-05T21:13:36Z","title":"Training Agents using Upside-Down Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"1912.02877","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1912.02877","snapshot_observed_at":"2026-07-02T21:57:25.915173Z","title":"Training agents using upside-down reinforcement learning","venue":null,"work_id":"56a8b123-20b1-4269-a9b7-e11faaab37e7","year":1912},"citing_paper":{"arxiv_id":"2605.01862","last_updated":"2026-05-08T03:23:44Z","snapshot_observed_at":"2026-08-17T03:35:49.937485Z","submitted_at":"2026-05-03T13:11:28Z","title":"QHyer: Q-conditioned Hybrid Attention-mamba Transformer for Offline Goal-conditioned RL","version":2},"reference_index":232,"source":"arxiv_source","source_observed_at":"2026-05-11T01:17:48.643521Z"},"links":{"cited_paper":"/paper/1912.02877","citing_paper":"/paper/2605.01862"},"observation_digest":"sha256:010e382203a8dc9ce6c4dfe2fbc6bc750c16824120732e2def599bcf8d571344","observation_id":"07d1701b-aded-4818-9ad6-1aa0f6fc72eb","resolution":{"observed_at":"2026-05-11T04:30:58.178293Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.02877","last_updated":"2021-09-03T22:15:10Z","snapshot_observed_at":"2026-08-07T04:02:10.973662Z","submitted_at":"2019-12-05T21:13:36Z","title":"Training Agents using Upside-Down Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"1912.02877","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1912.02877","snapshot_observed_at":"2026-07-02T21:57:25.915173Z","title":"Training agents using upside-down reinforcement learning","venue":null,"work_id":"56a8b123-20b1-4269-a9b7-e11faaab37e7","year":1912},"citing_paper":{"arxiv_id":"2606.08312","last_updated":"2026-06-06T19:55:54Z","snapshot_observed_at":"2026-07-06T23:47:48.634024Z","submitted_at":"2026-06-06T19:55:54Z","title":"Neuro-Symbolic Injection of LTLf Constraints in Autoregressive Reinforcement Learning Policies","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-27T19:23:32.966503Z"},"links":{"cited_paper":"/paper/1912.02877","citing_paper":"/paper/2606.08312"},"observation_digest":"sha256:e0fa08aa7e115b676a48d83698c9c49ff65e55c4c91dcca93f2adaaa58c6918b","observation_id":"b33bb334-208a-4f7b-b6bd-9a6d9280bba5","resolution":{"observed_at":"2026-07-02T21:57:25.916771Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.02877","last_updated":"2021-09-03T22:15:10Z","snapshot_observed_at":"2026-08-07T04:02:10.973662Z","submitted_at":"2019-12-05T21:13:36Z","title":"Training Agents using Upside-Down Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.02877","snapshot_observed_at":"2026-08-01T17:45:14.105428Z","title":"arXiv preprint arXiv:1912.02877 , year=","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2607.17560","last_updated":"2026-07-20T05:09:36Z","snapshot_observed_at":"2026-08-05T13:38:45.921055Z","submitted_at":"2026-07-20T05:09:36Z","title":"Reinforcement Learning: From Algorithms To Foundation Models","version":1},"reference_index":174,"source":"arxiv_source","source_observed_at":"2026-08-01T17:45:14.105428Z"},"links":{"cited_paper":"/paper/1912.02877","citing_paper":"/paper/2607.17560"},"observation_digest":"sha256:28cfda145416363e4c9b61bf5e8fb9a1a8deb524999297e3b539664bcc100a43","observation_id":"fc21b51e-44c7-4011-86bc-1d869c0540fc","resolution":{"observed_at":"2026-08-01T17:45:14.105428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.02877","last_updated":"2021-09-03T22:15:10Z","snapshot_observed_at":"2026-08-07T04:02:10.973662Z","submitted_at":"2019-12-05T21:13:36Z","title":"Training Agents using Upside-Down Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.02877","snapshot_observed_at":"2026-08-03T04:39:32.197052Z","title":"Training","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2607.29559","last_updated":"2026-07-31T15:50:29Z","snapshot_observed_at":"2026-08-07T18:56:05.725689Z","submitted_at":"2026-07-31T15:50:29Z","title":"LEMUR: Learning to Align with Multi-Objective Reinforcement Learning from Preference Feedback","version":1},"reference_index":269,"source":"arxiv_source","source_observed_at":"2026-08-03T04:39:32.197052Z"},"links":{"cited_paper":"/paper/1912.02877","citing_paper":"/paper/2607.29559"},"observation_digest":"sha256:372ef46283232378f835f749f80e81090ef016ddc1397d58be3eb7b5a32038e3","observation_id":"008ffa89-a4da-4946-90dd-a2c1f29c159c","resolution":{"observed_at":"2026-08-03T04:39:32.197052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/1912.02877/citation-record","integrity":"/paper/1912.02877/integrity","json":"/paper/1912.02877/citation-record.json","paper":"/paper/1912.02877"},"outbound":[],"paper":{"arxiv_id":"1912.02877","last_updated":"2021-09-03T22:15:10Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T04:02:10.973662Z","submitted_at":"2019-12-05T21:13:36Z","title":"Training Agents using Upside-Down Reinforcement Learning"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 18 inbound Pith citation observations for arXiv:1912.02877."}