{"as_of":"2026-08-20T17:48:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:dea3c54dafa39362c03fd88ddfd5625860c766abd3f30a5dae1951e47a70d442","coverage":[{"denominator":50,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":50,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T18:35:59.796489Z","state":"measured"},{"denominator":50,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":50,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2411.11457/citation-record","integrity":"/paper/2411.11457/integrity","json":"/paper/2411.11457/citation-record.json","paper":"/paper/2411.11457"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:35:59.608437Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.11457","last_updated":"2024-11-18T10:44:20Z","snapshot_observed_at":"2026-08-17T09:25:13.586799Z","submitted_at":"2024-11-18T10:44:20Z","title":"Upside-Down Reinforcement Learning for More Interpretable Optimal Control","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-12T18:35:59.608437Z"},"links":{"citing_paper":"/paper/2411.11457"},"observation_digest":"sha256:67834aeae80fa178a694b601f4b57fdb2c2ef8da4b7e44f502209a75c0cb66d5","observation_id":"2bdfe559-f9ee-4bae-a6cd-366433b95602","resolution":{"observed_at":"2026-08-12T18:35:59.608437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:36:00.395504Z","title":"and Mishra, S","venue":null,"work_id":"8ecdc4b2-52b3-419c-bfe6-9e4fea585083","year":2021},"citing_paper":{"arxiv_id":"2411.11457","last_updated":"2024-11-18T10:44:20Z","snapshot_observed_at":"2026-08-17T09:25:13.586799Z","submitted_at":"2024-11-18T10:44:20Z","title":"Upside-Down Reinforcement Learning for More Interpretable Optimal Control","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-12T18:35:59.614212Z"},"links":{"citing_paper":"/paper/2411.11457"},"observation_digest":"sha256:4b4e37707c13198442fc6ab16a22b066ee934ae74836bf788cf38bace8e81e3b","observation_id":"abb3a62d-6a64-41a0-8675-4821a0df9f8f","resolution":{"observed_at":"2026-08-12T18:36:00.399198Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:36:00.383978Z","title":null,"venue":null,"work_id":"5b64ee6e-9e6b-438e-9bda-3d05f12e5ee1","year":2024},"citing_paper":{"arxiv_id":"2411.11457","last_updated":"2024-11-18T10:44:20Z","snapshot_observed_at":"2026-08-17T09:25:13.586799Z","submitted_at":"2024-11-18T10:44:20Z","title":"Upside-Down Reinforcement Learning for More Interpretable Optimal Control","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-12T18:35:59.619203Z"},"links":{"citing_paper":"/paper/2411.11457"},"observation_digest":"sha256:bdc737d7331985d2a9738d60545ffd5bebdaeb4ed16b45ca1b83c19d84115667","observation_id":"a29ac238-2445-4f64-a265-a146a823f43f","resolution":{"observed_at":"2026-08-12T18:36:00.387963Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.11960","last_updated":"2022-02-24T08:44:11Z","snapshot_observed_at":"2026-08-16T17:19:00.226123Z","submitted_at":"2022-02-24T08:44:11Z","title":"All You Need Is Supervised Learning: From Imitation Learning to Meta-RL With Upside Down RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.11960","snapshot_observed_at":"2026-08-12T18:35:59.623576Z","title":"R., Schmidhuber, J., and Srivastava, R","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.11457","last_updated":"2024-11-18T10:44:20Z","snapshot_observed_at":"2026-08-17T09:25:13.586799Z","submitted_at":"2024-11-18T10:44:20Z","title":"Upside-Down Reinforcement Learning for More Interpretable Optimal Control","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-12T18:35:59.623576Z"},"links":{"cited_paper":"/paper/2202.11960","citing_paper":"/paper/2411.11457"},"observation_digest":"sha256:f05c5cb35d1276a81e42a37c868f13fd506515a9790fbe48d3bbf65991a10c36","observation_id":"5f06d254-b2f7-44b0-9c53-1105dd80dc89","resolution":{"observed_at":"2026-08-12T18:35:59.623576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.12742","last_updated":"2022-05-10T13:05:58Z","snapshot_observed_at":"2026-08-17T12:53:58.877626Z","submitted_at":"2022-02-23T07:21:44Z","title":"Learning Relative Return Policies With Upside-Down Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2202.12742","doi":null,"metadata_source":"pith","pith_arxiv_id":"2202.12742","snapshot_observed_at":"2026-08-12T18:35:59.918644Z","title":"Learning Relative Return Policies With Upside-Down Reinforcement Learning","venue":"cs.LG","work_id":"ef71614a-5271-4cb9-ace0-e19bfef20cf2","year":2022},"citing_paper":{"arxiv_id":"2411.11457","last_updated":"2024-11-18T10:44:20Z","snapshot_observed_at":"2026-08-17T09:25:13.586799Z","submitted_at":"2024-11-18T10:44:20Z","title":"Upside-Down Reinforcement Learning for More Interpretable Optimal Control","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-12T18:35:59.627958Z"},"links":{"cited_paper":"/paper/2202.12742","citing_paper":"/paper/2411.11457"},"observation_digest":"sha256:4c832fb04cf5dd729d9e63736b3707aa2aeb660877c03b1c436c81ae4f9f5fa7","observation_id":"d8711a58-671b-4cde-9fb0-e2c312369abd","resolution":{"observed_at":"2026-08-12T18:35:59.922846Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:36:00.370938Z","title":"G., Sutton, R","venue":null,"work_id":"98b4c8dc-f3ed-4d1b-a5cc-dca5b81ee200","year":1983},"citing_paper":{"arxiv_id":"2411.11457","last_updated":"2024-11-18T10:44:20Z","snapshot_observed_at":"2026-08-17T09:25:13.586799Z","submitted_at":"2024-11-18T10:44:20Z","title":"Upside-Down Reinforcement Learning for More Interpretable Optimal Control","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-12T18:35:59.632421Z"},"links":{"citing_paper":"/paper/2411.11457"},"observation_digest":"sha256:3c0b4a8e716d9e09f575306d50505fe015a7b2eb7eeb7c8575cf2c1d40812bde","observation_id":"4d3df4d2-cb04-4778-a7ac-f2f997510db1","resolution":{"observed_at":"2026-08-12T18:36:00.375535Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:35:59.636180Z","title":null,"venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2411.11457","last_updated":"2024-11-18T10:44:20Z","snapshot_observed_at":"2026-08-17T09:25:13.586799Z","submitted_at":"2024-11-18T10:44:20Z","title":"Upside-Down Reinforcement Learning for More Interpretable Optimal Control","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-12T18:35:59.636180Z"},"links":{"citing_paper":"/paper/2411.11457"},"observation_digest":"sha256:31e3aeec499f0561617aef591e7bc829fa6a7b8be5a57f2df89f4a9fb3fe7e2b","observation_id":"356fc9e3-a00e-43f0-8fe1-b43b19252053","resolution":{"observed_at":"2026-08-12T18:35:59.636180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:36:00.351574Z","title":null,"venue":null,"work_id":"ddf7fa39-0e37-47ff-95ef-a8ddb2731106","year":2021},"citing_paper":{"arxiv_id":"2411.11457","last_updated":"2024-11-18T10:44:20Z","snapshot_observed_at":"2026-08-17T09:25:13.586799Z","submitted_at":"2024-11-18T10:44:20Z","title":"Upside-Down Reinforcement Learning for More Interpretable Optimal Control","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-12T18:35:59.640291Z"},"links":{"citing_paper":"/paper/2411.11457"},"observation_digest":"sha256:a85413dd4a7de0bbe0ec089a5cf978dd52467dfad8932e526687edac61dc0c21","observation_id":"fb3827f9-b6af-4954-a12f-8b0c649e1fbb","resolution":{"observed_at":"2026-08-12T18:36:00.356335Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:36:00.338952Z","title":null,"venue":null,"work_id":"a41ef5c9-fd1a-4bd5-9856-3d05a9b09da5","year":2022},"citing_paper":{"arxiv_id":"2411.11457","last_updated":"2024-11-18T10:44:20Z","snapshot_observed_at":"2026-08-17T09:25:13.586799Z","submitted_at":"2024-11-18T10:44:20Z","title":"Upside-Down Reinforcement Learning for More Interpretable Optimal Control","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-12T18:35:59.644021Z"},"links":{"citing_paper":"/paper/2411.11457"},"observation_digest":"sha256:1f6d506f61242a2910c6ffa6bfd6fe73cee48fbab8541917913bd9f40c2f2a72","observation_id":"7f6b6e94-cfb7-4d46-9236-d7c4e1798352","resolution":{"observed_at":"2026-08-12T18:36:00.343117Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:36:00.326755Z","title":null,"venue":null,"work_id":"07d71bf0-12dc-4402-aef9-39e4b5e7a500","year":2017},"citing_paper":{"arxiv_id":"2411.11457","last_updated":"2024-11-18T10:44:20Z","snapshot_observed_at":"2026-08-17T09:25:13.586799Z","submitted_at":"2024-11-18T10:44:20Z","title":"Upside-Down Reinforcement Learning for More Interpretable Optimal Control","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-12T18:35:59.647621Z"},"links":{"citing_paper":"/paper/2411.11457"},"observation_digest":"sha256:22da3732ba13e1cd8cd82d481dc041eb6c8327487c0aa653ac1fe6ea9edf5add","observation_id":"d21af92e-d3c8-4ea6-b0ca-c53355df626d","resolution":{"observed_at":"2026-08-12T18:36:00.330895Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:36:00.314524Z","title":null,"venue":null,"work_id":"057d1bdc-9623-48b2-8bf1-ff1add56885c","year":2021},"citing_paper":{"arxiv_id":"2411.11457","last_updated":"2024-11-18T10:44:20Z","snapshot_observed_at":"2026-08-17T09:25:13.586799Z","submitted_at":"2024-11-18T10:44:20Z","title":"Upside-Down Reinforcement Learning for More Interpretable Optimal Control","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-12T18:35:59.651418Z"},"links":{"citing_paper":"/paper/2411.11457"},"observation_digest":"sha256:0be5c5b68ce0e5e4080517f74f5a899d14c347bfe430bba9bc00d2917259088c","observation_id":"805e1cfb-34f3-4478-b0a6-caa6085156b5","resolution":{"observed_at":"2026-08-12T18:36:00.318334Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:36:00.301298Z","title":"and Hart, P","venue":null,"work_id":"2e388c93-4409-4bb9-85c3-4b1d608a6bd8","year":1967},"citing_paper":{"arxiv_id":"2411.11457","last_updated":"2024-11-18T10:44:20Z","snapshot_observed_at":"2026-08-17T09:25:13.586799Z","submitted_at":"2024-11-18T10:44:20Z","title":"Upside-Down Reinforcement Learning for More Interpretable Optimal Control","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-12T18:35:59.656560Z"},"links":{"citing_paper":"/paper/2411.11457"},"observation_digest":"sha256:b7f86c76519e419ee3df7019052298feb34adeb1bfee1f8feabbb01f9701a36e","observation_id":"c303bfe3-5043-4dc1-bc5e-94e1c89e15a4","resolution":{"observed_at":"2026-08-12T18:36:00.305489Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:35:59.661138Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.11457","last_updated":"2024-11-18T10:44:20Z","snapshot_observed_at":"2026-08-17T09:25:13.586799Z","submitted_at":"2024-11-18T10:44:20Z","title":"Upside-Down Reinforcement Learning for More Interpretable Optimal Control","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-12T18:35:59.661138Z"},"links":{"citing_paper":"/paper/2411.11457"},"observation_digest":"sha256:a69af39585b681db431259cd8dc0e44d0728eab408a676afd6a352fa565cf7f8","observation_id":"0291fb40-5715-4138-b17e-695f96393908","resolution":{"observed_at":"2026-08-12T18:35:59.661138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:36:00.280232Z","title":null,"venue":null,"work_id":"2faedadc-78d0-474a-af7b-da628a5bf535","year":2005},"citing_paper":{"arxiv_id":"2411.11457","last_updated":"2024-11-18T10:44:20Z","snapshot_observed_at":"2026-08-17T09:25:13.586799Z","submitted_at":"2024-11-18T10:44:20Z","title":"Upside-Down Reinforcement Learning for More Interpretable Optimal Control","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-12T18:35:59.664712Z"},"links":{"citing_paper":"/paper/2411.11457"},"observation_digest":"sha256:03c603142b4fbcf26ded55dd36ffc1af83a18f5bb2d1571e3ea48bcd65eca7cd","observation_id":"a8b6ea7f-fc98-4de4-9809-652779e16cb0","resolution":{"observed_at":"2026-08-12T18:36:00.284611Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:36:00.268317Z","title":null,"venue":null,"work_id":"6fa03dec-31ad-4083-9241-c8c132b29abb","year":2006},"citing_paper":{"arxiv_id":"2411.11457","last_updated":"2024-11-18T10:44:20Z","snapshot_observed_at":"2026-08-17T09:25:13.586799Z","submitted_at":"2024-11-18T10:44:20Z","title":"Upside-Down Reinforcement Learning for More Interpretable Optimal Control","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-12T18:35:59.668061Z"},"links":{"citing_paper":"/paper/2411.11457"},"observation_digest":"sha256:95c5f27686345f127dac9517b197343333e675356fdc7251f0c737ebbac60ae5","observation_id":"5c374c7d-2122-4422-8d62-101f6fee61e1","resolution":{"observed_at":"2026-08-12T18:36:00.272324Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:36:00.255954Z","title":null,"venue":null,"work_id":"92ae350d-e51c-4d00-910f-0593e7608b2a","year":2006},"citing_paper":{"arxiv_id":"2411.11457","last_updated":"2024-11-18T10:44:20Z","snapshot_observed_at":"2026-08-17T09:25:13.586799Z","submitted_at":"2024-11-18T10:44:20Z","title":"Upside-Down Reinforcement Learning for More Interpretable Optimal Control","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-12T18:35:59.671467Z"},"links":{"citing_paper":"/paper/2411.11457"},"observation_digest":"sha256:0ebd900f3ea89583b84265e3b5b14fd3bea1612bceee8d5b4e90c5b4b32d2df2","observation_id":"e2ae35d7-bfd2-4d5d-b482-327d410a24d3","resolution":{"observed_at":"2026-08-12T18:36:00.260146Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:36:00.243053Z","title":"E., et al","venue":null,"work_id":"9c741e49-a87b-446a-8af7-8f73dfc2df00","year":1996},"citing_paper":{"arxiv_id":"2411.11457","last_updated":"2024-11-18T10:44:20Z","snapshot_observed_at":"2026-08-17T09:25:13.586799Z","submitted_at":"2024-11-18T10:44:20Z","title":"Upside-Down Reinforcement Learning for More Interpretable Optimal Control","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-12T18:35:59.675111Z"},"links":{"citing_paper":"/paper/2411.11457"},"observation_digest":"sha256:251079f72e85b63e25dad7fd0011da76eef58e2c1caabacc9c277a4408f1d49d","observation_id":"afa1af9c-2172-4f6a-a10f-d1fcd82c4cfb","resolution":{"observed_at":"2026-08-12T18:36:00.247060Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:35:59.678651Z","title":null,"venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2411.11457","last_updated":"2024-11-18T10:44:20Z","snapshot_observed_at":"2026-08-17T09:25:13.586799Z","submitted_at":"2024-11-18T10:44:20Z","title":"Upside-Down Reinforcement Learning for More Interpretable Optimal Control","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-12T18:35:59.678651Z"},"links":{"citing_paper":"/paper/2411.11457"},"observation_digest":"sha256:e5718809b94c1daacab7ed189df20779dfda71df73954fb71d756c00aa4ca696","observation_id":"c747cf82-8295-4991-a24c-1f977f7eccfe","resolution":{"observed_at":"2026-08-12T18:35:59.678651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.10364","last_updated":"2022-02-04T14:03:07Z","snapshot_observed_at":"2026-08-16T17:40:36.764753Z","submitted_at":"2021-11-19T18:56:13Z","title":"Generalized Decision Transformer for Offline Hindsight Information Matching","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.10364","snapshot_observed_at":"2026-08-12T18:35:59.682047Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.11457","last_updated":"2024-11-18T10:44:20Z","snapshot_observed_at":"2026-08-17T09:25:13.586799Z","submitted_at":"2024-11-18T10:44:20Z","title":"Upside-Down Reinforcement Learning for More Interpretable Optimal Control","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-12T18:35:59.682047Z"},"links":{"cited_paper":"/paper/2111.10364","citing_paper":"/paper/2411.11457"},"observation_digest":"sha256:13401c2f858dbb4fc31d749e6793061dbfa5000925fd54a29955d82dad0142e2","observation_id":"946b6186-11c2-4f8a-97e6-e932345ed70f","resolution":{"observed_at":"2026-08-12T18:35:59.682047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:35:59.686181Z","title":null,"venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2411.11457","last_updated":"2024-11-18T10:44:20Z","snapshot_observed_at":"2026-08-17T09:25:13.586799Z","submitted_at":"2024-11-18T10:44:20Z","title":"Upside-Down Reinforcement Learning for More Interpretable Optimal Control","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-12T18:35:59.686181Z"},"links":{"citing_paper":"/paper/2411.11457"},"observation_digest":"sha256:aec88638e565901383814b128bca79de1c4f4ffbb354dc2f993b187e4d0fd238","observation_id":"becba9f6-d4e7-47b3-b584-eaca283b99b6","resolution":{"observed_at":"2026-08-12T18:35:59.686181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:36:00.217202Z","title":null,"venue":null,"work_id":"bb95464f-9b36-454f-88a1-42c7a0e3b1fc","year":2024},"citing_paper":{"arxiv_id":"2411.11457","last_updated":"2024-11-18T10:44:20Z","snapshot_observed_at":"2026-08-17T09:25:13.586799Z","submitted_at":"2024-11-18T10:44:20Z","title":"Upside-Down Reinforcement Learning for More Interpretable Optimal Control","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-12T18:35:59.689567Z"},"links":{"citing_paper":"/paper/2411.11457"},"observation_digest":"sha256:c39b11072ce867e6984aef9b161bf3564465769f4fc96d122769da6fdcce4979","observation_id":"fdef25be-0db2-4f12-a82d-bc3adcb58a4e","resolution":{"observed_at":"2026-08-12T18:36:00.221200Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:36:00.205065Z","title":null,"venue":null,"work_id":"0b944d46-65cb-4dc5-b12b-cf9c0c95ce6a","year":2019},"citing_paper":{"arxiv_id":"2411.11457","last_updated":"2024-11-18T10:44:20Z","snapshot_observed_at":"2026-08-17T09:25:13.586799Z","submitted_at":"2024-11-18T10:44:20Z","title":"Upside-Down Reinforcement Learning for More Interpretable Optimal Control","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-12T18:35:59.692976Z"},"links":{"citing_paper":"/paper/2411.11457"},"observation_digest":"sha256:91c13eeeace8bfaada745db2d63d656e63b1b9ae4534a003503d01ed1eb3efdb","observation_id":"302823e9-b521-4a8f-919c-2d8d23f4a813","resolution":{"observed_at":"2026-08-12T18:36:00.208953Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:36:00.192686Z","title":null,"venue":null,"work_id":"e7c7ae9b-c2c4-465e-8160-9ed5c235dbf7","year":2019},"citing_paper":{"arxiv_id":"2411.11457","last_updated":"2024-11-18T10:44:20Z","snapshot_observed_at":"2026-08-17T09:25:13.586799Z","submitted_at":"2024-11-18T10:44:20Z","title":"Upside-Down Reinforcement Learning for More Interpretable Optimal Control","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-12T18:35:59.696297Z"},"links":{"citing_paper":"/paper/2411.11457"},"observation_digest":"sha256:13c6d60b13bfa587643d975cdb972e01d551ac96938172e589e1cedccd585eda","observation_id":"8ca6e5eb-2068-4c52-aa7a-acf85b2f1f75","resolution":{"observed_at":"2026-08-12T18:36:00.197096Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:35:59.699667Z","title":null,"venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2411.11457","last_updated":"2024-11-18T10:44:20Z","snapshot_observed_at":"2026-08-17T09:25:13.586799Z","submitted_at":"2024-11-18T10:44:20Z","title":"Upside-Down Reinforcement Learning for More Interpretable Optimal Control","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-12T18:35:59.699667Z"},"links":{"citing_paper":"/paper/2411.11457"},"observation_digest":"sha256:5a5c2e12f4aa69c4c398a9de8d0158edfb559a27fd80a579ac052fdbf4458f83","observation_id":"5a6a0b13-8e32-4fc3-b387-3ee9ae08df0d","resolution":{"observed_at":"2026-08-12T18:35:59.699667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:36:00.172418Z","title":"G., Pisane, J., Kolios, A., and Ernst, D","venue":null,"work_id":"037b00a4-91a6-408d-8c2e-875614d52653","year":2024},"citing_paper":{"arxiv_id":"2411.11457","last_updated":"2024-11-18T10:44:20Z","snapshot_observed_at":"2026-08-17T09:25:13.586799Z","submitted_at":"2024-11-18T10:44:20Z","title":"Upside-Down Reinforcement Learning for More Interpretable Optimal Control","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-12T18:35:59.703145Z"},"links":{"citing_paper":"/paper/2411.11457"},"observation_digest":"sha256:64f5f07f59882a562dac76c506b7636175a5b8a0ddfcd287ca67f0193d362b9a","observation_id":"203b2ee3-f44c-41ef-8dac-d0c729cbe1bd","resolution":{"observed_at":"2026-08-12T18:36:00.176905Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.08299","last_updated":"2022-09-02T10:46:40Z","snapshot_observed_at":"2026-08-16T17:27:02.445517Z","submitted_at":"2022-01-20T17:06:42Z","title":"Goal-Conditioned Reinforcement Learning: Problems and Solutions","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.08299","snapshot_observed_at":"2026-08-12T18:35:59.706912Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.11457","last_updated":"2024-11-18T10:44:20Z","snapshot_observed_at":"2026-08-17T09:25:13.586799Z","submitted_at":"2024-11-18T10:44:20Z","title":"Upside-Down Reinforcement Learning for More Interpretable Optimal Control","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-12T18:35:59.706912Z"},"links":{"cited_paper":"/paper/2201.08299","citing_paper":"/paper/2411.11457"},"observation_digest":"sha256:b8acec569ccf0b8ca89148a6b96f9ddf7798a1458b4d3c5727c48eba45cae399","observation_id":"4b876560-7f52-4f3a-b377-c66222a2351a","resolution":{"observed_at":"2026-08-12T18:35:59.706912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:36:00.160594Z","title":null,"venue":null,"work_id":"638daf44-f510-499a-86e2-a8adf6b4dfd5","year":2013},"citing_paper":{"arxiv_id":"2411.11457","last_updated":"2024-11-18T10:44:20Z","snapshot_observed_at":"2026-08-17T09:25:13.586799Z","submitted_at":"2024-11-18T10:44:20Z","title":"Upside-Down Reinforcement Learning for More Interpretable Optimal Control","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-12T18:35:59.711006Z"},"links":{"citing_paper":"/paper/2411.11457"},"observation_digest":"sha256:bcd9574ad7a3e66da4f24fc29241394ff1ca9a514ac169177609ad4e0c19437d","observation_id":"00a8459a-452e-49f8-934d-8147ed3222b6","resolution":{"observed_at":"2026-08-12T18:36:00.164422Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:36:00.148290Z","title":null,"venue":null,"work_id":"97b9378b-119a-4eec-b823-17045a4bbe33","year":2005},"citing_paper":{"arxiv_id":"2411.11457","last_updated":"2024-11-18T10:44:20Z","snapshot_observed_at":"2026-08-17T09:25:13.586799Z","submitted_at":"2024-11-18T10:44:20Z","title":"Upside-Down Reinforcement Learning for More Interpretable Optimal Control","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-12T18:35:59.714854Z"},"links":{"citing_paper":"/paper/2411.11457"},"observation_digest":"sha256:58346c4878692f0b7cdc14cd05b74fc2e88c9966461a0c89ae848257b7d158bc","observation_id":"b4402b34-2019-4601-9143-c974431e8000","resolution":{"observed_at":"2026-08-12T18:36:00.152815Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:36:00.136392Z","title":"A., de Lope, J., and Maravall, D","venue":null,"work_id":"936198ff-c48a-4976-b82c-d13f2ac89c91","year":2009},"citing_paper":{"arxiv_id":"2411.11457","last_updated":"2024-11-18T10:44:20Z","snapshot_observed_at":"2026-08-17T09:25:13.586799Z","submitted_at":"2024-11-18T10:44:20Z","title":"Upside-Down Reinforcement Learning for More Interpretable Optimal Control","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-12T18:35:59.718392Z"},"links":{"citing_paper":"/paper/2411.11457"},"observation_digest":"sha256:c96956ccf10b01c0c47a7e23b2a118d134dc921e2f58d411bda89a00117c2497","observation_id":"4d233def-ac71-4df7-b44a-b982ce9c86c8","resolution":{"observed_at":"2026-08-12T18:36:00.140298Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.03771","last_updated":"2022-04-07T23:00:39Z","snapshot_observed_at":"2026-08-17T23:24:58.389104Z","submitted_at":"2022-04-07T23:00:39Z","title":"Q-learning with online random forests","version":1},"cited_work":{"arxiv_id":"2204.03771","doi":null,"metadata_source":"pith","pith_arxiv_id":"2204.03771","snapshot_observed_at":"2026-08-12T18:35:59.876718Z","title":"Q-learning with online random forests","venue":"stat.ML","work_id":"4f60ee94-e650-4ff3-88b1-cb7a42954729","year":2022},"citing_paper":{"arxiv_id":"2411.11457","last_updated":"2024-11-18T10:44:20Z","snapshot_observed_at":"2026-08-17T09:25:13.586799Z","submitted_at":"2024-11-18T10:44:20Z","title":"Upside-Down Reinforcement Learning for More Interpretable Optimal Control","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-12T18:35:59.722299Z"},"links":{"cited_paper":"/paper/2204.03771","citing_paper":"/paper/2411.11457"},"observation_digest":"sha256:341fb31e621fe3b1d36bac26c5e97f69c88c2a3619a2c792c771174d4291f5b5","observation_id":"1a1af645-6662-47f5-99ce-265f2350f2bd","resolution":{"observed_at":"2026-08-12T18:35:59.882991Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:36:00.124067Z","title":null,"venue":null,"work_id":"1a74bfd3-a783-4f4c-bac4-0d6030242ca1","year":2017},"citing_paper":{"arxiv_id":"2411.11457","last_updated":"2024-11-18T10:44:20Z","snapshot_observed_at":"2026-08-17T09:25:13.586799Z","submitted_at":"2024-11-18T10:44:20Z","title":"Upside-Down Reinforcement Learning for More Interpretable Optimal Control","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-12T18:35:59.726465Z"},"links":{"citing_paper":"/paper/2411.11457"},"observation_digest":"sha256:a656550d0d8a95a6a25c9341e308d5445fee484a3ee9690554b43ffb193cc626","observation_id":"7ceaf3c9-5804-4fa8-b4d8-1ad46ccde549","resolution":{"observed_at":"2026-08-12T18:36:00.128061Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:36:00.112663Z","title":"J., and Moyà-Alcover, G","venue":null,"work_id":"a6161eea-7392-495c-a0fd-b3f65b6ae95e","year":2025},"citing_paper":{"arxiv_id":"2411.11457","last_updated":"2024-11-18T10:44:20Z","snapshot_observed_at":"2026-08-17T09:25:13.586799Z","submitted_at":"2024-11-18T10:44:20Z","title":"Upside-Down Reinforcement Learning for More Interpretable Optimal Control","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-12T18:35:59.730152Z"},"links":{"citing_paper":"/paper/2411.11457"},"observation_digest":"sha256:d18d2743cc2f966cc37efe5f2cde5adfe20839da5a5093be39a48a9895472d76","observation_id":"d3a0bc44-5ee8-4a3e-addf-3c405e51ff49","resolution":{"observed_at":"2026-08-12T18:36:00.116517Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:36:00.100542Z","title":null,"venue":null,"work_id":"bfe436f5-abde-4ded-be62-0e0ce2f539c5","year":2024},"citing_paper":{"arxiv_id":"2411.11457","last_updated":"2024-11-18T10:44:20Z","snapshot_observed_at":"2026-08-17T09:25:13.586799Z","submitted_at":"2024-11-18T10:44:20Z","title":"Upside-Down Reinforcement Learning for More Interpretable Optimal Control","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-12T18:35:59.733683Z"},"links":{"citing_paper":"/paper/2411.11457"},"observation_digest":"sha256:5d6c3d16a996460758c2c4ea432ca870a9df9de1426c2471670253aa13635d1e","observation_id":"39603694-50ef-4e27-affb-57c7eb754f85","resolution":{"observed_at":"2026-08-12T18:36:00.104713Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:36:00.088876Z","title":null,"venue":null,"work_id":"4dde3fd1-1a76-47a2-992e-09d0ab4e6cde","year":2023},"citing_paper":{"arxiv_id":"2411.11457","last_updated":"2024-11-18T10:44:20Z","snapshot_observed_at":"2026-08-17T09:25:13.586799Z","submitted_at":"2024-11-18T10:44:20Z","title":"Upside-Down Reinforcement Learning for More Interpretable Optimal Control","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-12T18:35:59.736993Z"},"links":{"citing_paper":"/paper/2411.11457"},"observation_digest":"sha256:a4c4bf6c7333da27046bde6afe833d07f318d92c03c48bffa2ad7419457e1731","observation_id":"0d9da2dd-e1a4-49e1-b420-d93758669cf1","resolution":{"observed_at":"2026-08-12T18:36:00.092837Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:35:59.740227Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.11457","last_updated":"2024-11-18T10:44:20Z","snapshot_observed_at":"2026-08-17T09:25:13.586799Z","submitted_at":"2024-11-18T10:44:20Z","title":"Upside-Down Reinforcement Learning for More Interpretable Optimal Control","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-12T18:35:59.740227Z"},"links":{"citing_paper":"/paper/2411.11457"},"observation_digest":"sha256:47126d9d2c649a82dff740e0b03c0a766001b77305e2f188610f45daa43d2609","observation_id":"fcd2e4fa-b7db-4bfe-98e2-fe534b1db697","resolution":{"observed_at":"2026-08-12T18:35:59.740227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:35:59.743996Z","title":null,"venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2411.11457","last_updated":"2024-11-18T10:44:20Z","snapshot_observed_at":"2026-08-17T09:25:13.586799Z","submitted_at":"2024-11-18T10:44:20Z","title":"Upside-Down Reinforcement Learning for More Interpretable Optimal Control","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-12T18:35:59.743996Z"},"links":{"citing_paper":"/paper/2411.11457"},"observation_digest":"sha256:8ddf65014ec69dc007f247ce7e45243af9c049f64ee20cfb849abc2b9306ac48","observation_id":"4666b078-bf88-4c11-bec8-d7bc8cd7ed62","resolution":{"observed_at":"2026-08-12T18:35:59.743996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1704.06300","last_updated":"2017-04-20T18:53:51Z","snapshot_observed_at":"2026-08-15T03:38:56.220511Z","submitted_at":"2017-04-20T18:53:51Z","title":"A Reinforcement Learning Approach to Weaning of Mechanical Ventilation in Intensive Care Units","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1704.06300","snapshot_observed_at":"2026-08-12T18:35:59.747396Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.11457","last_updated":"2024-11-18T10:44:20Z","snapshot_observed_at":"2026-08-17T09:25:13.586799Z","submitted_at":"2024-11-18T10:44:20Z","title":"Upside-Down Reinforcement Learning for More Interpretable Optimal Control","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-12T18:35:59.747396Z"},"links":{"cited_paper":"/paper/1704.06300","citing_paper":"/paper/2411.11457"},"observation_digest":"sha256:939a9a5014fdfe86abedc089b6eb073949078db340113561272e074a46a78034","observation_id":"d470a829-5ff8-4a2f-8206-074ddbd89a5f","resolution":{"observed_at":"2026-08-12T18:35:59.747396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:35:59.751444Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2411.11457","last_updated":"2024-11-18T10:44:20Z","snapshot_observed_at":"2026-08-17T09:25:13.586799Z","submitted_at":"2024-11-18T10:44:20Z","title":"Upside-Down Reinforcement Learning for More Interpretable Optimal Control","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-12T18:35:59.751444Z"},"links":{"citing_paper":"/paper/2411.11457"},"observation_digest":"sha256:fe28bd5bcad594a4270b86df845183f020831c14bafe2c43522a65552d7a24cf","observation_id":"d6724efb-68e3-4366-b7e2-ccf4fcc47c4b","resolution":{"observed_at":"2026-08-12T18:35:59.751444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:35:59.755016Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.11457","last_updated":"2024-11-18T10:44:20Z","snapshot_observed_at":"2026-08-17T09:25:13.586799Z","submitted_at":"2024-11-18T10:44:20Z","title":"Upside-Down Reinforcement Learning for More Interpretable Optimal Control","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-12T18:35:59.755016Z"},"links":{"citing_paper":"/paper/2411.11457"},"observation_digest":"sha256:7d568153165e7f84b7a74b72853e3c5ba744d7a121ef19129e6d1b3a9064b519","observation_id":"e0c38d81-767c-44ec-ab96-e3a035356c7f","resolution":{"observed_at":"2026-08-12T18:35:59.755016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1704.02532","last_updated":"2017-04-08T20:04:03Z","snapshot_observed_at":"2026-08-19T03:36:21.853521Z","submitted_at":"2017-04-08T20:04:03Z","title":"Deep Reinforcement Learning framework for Autonomous Driving","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1704.02532","snapshot_observed_at":"2026-08-12T18:35:59.758519Z","title":"E., Abdou, M., Perot, E., and Yogamani, S","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.11457","last_updated":"2024-11-18T10:44:20Z","snapshot_observed_at":"2026-08-17T09:25:13.586799Z","submitted_at":"2024-11-18T10:44:20Z","title":"Upside-Down Reinforcement Learning for More Interpretable Optimal Control","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-12T18:35:59.758519Z"},"links":{"cited_paper":"/paper/1704.02532","citing_paper":"/paper/2411.11457"},"observation_digest":"sha256:82749f2409d54b6869407f5634db482060ebbda77de27bddf107a18f7dd19b47","observation_id":"7fce7cf5-155f-4588-9a64-85b414a3262b","resolution":{"observed_at":"2026-08-12T18:35:59.758519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.02875","last_updated":"2020-06-23T15:55:05Z","snapshot_observed_at":"2026-08-17T05:48:50.270608Z","submitted_at":"2019-12-05T21:10:08Z","title":"Reinforcement Learning Upside Down: Don't Predict Rewards -- Just Map Them to Actions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.02875","snapshot_observed_at":"2026-08-12T18:35:59.762452Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.11457","last_updated":"2024-11-18T10:44:20Z","snapshot_observed_at":"2026-08-17T09:25:13.586799Z","submitted_at":"2024-11-18T10:44:20Z","title":"Upside-Down Reinforcement Learning for More Interpretable Optimal Control","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-12T18:35:59.762452Z"},"links":{"cited_paper":"/paper/1912.02875","citing_paper":"/paper/2411.11457"},"observation_digest":"sha256:a04d39c2023ee04fa31a3a754f722c21022b5ac0c46c3b67cc9f530558b71a26","observation_id":"32f142d3-c417-4019-bb8a-747a4a27778c","resolution":{"observed_at":"2026-08-12T18:35:59.762452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:36:00.038476Z","title":"and Xie, Q","venue":null,"work_id":"4572b87d-23cb-45d3-8503-d8b5c93744ea","year":2018},"citing_paper":{"arxiv_id":"2411.11457","last_updated":"2024-11-18T10:44:20Z","snapshot_observed_at":"2026-08-17T09:25:13.586799Z","submitted_at":"2024-11-18T10:44:20Z","title":"Upside-Down Reinforcement Learning for More Interpretable Optimal Control","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-12T18:35:59.766504Z"},"links":{"citing_paper":"/paper/2411.11457"},"observation_digest":"sha256:75b3ba06d1640967de47f3ec90fa82a5b6d37e08946bf263796718749e46ba47","observation_id":"428271ff-1325-4d6a-a264-5acf5a065854","resolution":{"observed_at":"2026-08-12T18:36:00.048189Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:35:59.771028Z","title":"and Armon, A","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.11457","last_updated":"2024-11-18T10:44:20Z","snapshot_observed_at":"2026-08-17T09:25:13.586799Z","submitted_at":"2024-11-18T10:44:20Z","title":"Upside-Down Reinforcement Learning for More Interpretable Optimal Control","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-12T18:35:59.771028Z"},"links":{"citing_paper":"/paper/2411.11457"},"observation_digest":"sha256:aa340dcf65eb741d3f08b376def042add52e91f069d460f911dc8830ad1f7130","observation_id":"78b945d5-c1ce-468f-8318-7bd9334bd59b","resolution":{"observed_at":"2026-08-12T18:35:59.771028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:36:00.000663Z","title":"and Wang, L","venue":null,"work_id":"2d608caf-fc38-454c-8882-ed7fb5fec575","year":2024},"citing_paper":{"arxiv_id":"2411.11457","last_updated":"2024-11-18T10:44:20Z","snapshot_observed_at":"2026-08-17T09:25:13.586799Z","submitted_at":"2024-11-18T10:44:20Z","title":"Upside-Down Reinforcement Learning for More Interpretable Optimal Control","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-12T18:35:59.774377Z"},"links":{"citing_paper":"/paper/2411.11457"},"observation_digest":"sha256:cebd68096f437a9e5b6ecf97fa45ffba6b66a58b21007a6a83a25579e79a63f5","observation_id":"2b5cb02b-cd30-4de8-b819-8532c5117eba","resolution":{"observed_at":"2026-08-12T18:36:00.006631Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.02877","last_updated":"2021-09-03T22:15:10Z","snapshot_observed_at":"2026-08-07T04:02:10.973662Z","submitted_at":"2019-12-05T21:13:36Z","title":"Training Agents using Upside-Down Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.02877","snapshot_observed_at":"2026-08-12T18:35:59.778062Z","title":"K., Shyam, P., Mutz, F., Ja \\'s kowski, W., and Schmidhuber, J","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.11457","last_updated":"2024-11-18T10:44:20Z","snapshot_observed_at":"2026-08-17T09:25:13.586799Z","submitted_at":"2024-11-18T10:44:20Z","title":"Upside-Down Reinforcement Learning for More Interpretable Optimal Control","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-12T18:35:59.778062Z"},"links":{"cited_paper":"/paper/1912.02877","citing_paper":"/paper/2411.11457"},"observation_digest":"sha256:78b04ab5995f236005b432cec3fb7f0a5cd09c4ce13e874326f4fb51429511b4","observation_id":"0ff21285-d901-4b47-901b-4138ce934c81","resolution":{"observed_at":"2026-08-12T18:35:59.778062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:35:59.988884Z","title":null,"venue":null,"work_id":"f27d93c8-0813-454c-884a-3382fad43176","year":1995},"citing_paper":{"arxiv_id":"2411.11457","last_updated":"2024-11-18T10:44:20Z","snapshot_observed_at":"2026-08-17T09:25:13.586799Z","submitted_at":"2024-11-18T10:44:20Z","title":"Upside-Down Reinforcement Learning for More Interpretable Optimal Control","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-12T18:35:59.781808Z"},"links":{"citing_paper":"/paper/2411.11457"},"observation_digest":"sha256:d7b406570d42b78b8627b572d460b1d60653d4fd31e40de3cf07ce5fc3d61734","observation_id":"a4c67d7f-c38a-4553-b64b-7f11ccb22ce9","resolution":{"observed_at":"2026-08-12T18:35:59.992730Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:35:59.977221Z","title":null,"venue":null,"work_id":"fe1f2a21-cb95-4cd3-b896-4c663f0046d8","year":2006},"citing_paper":{"arxiv_id":"2411.11457","last_updated":"2024-11-18T10:44:20Z","snapshot_observed_at":"2026-08-17T09:25:13.586799Z","submitted_at":"2024-11-18T10:44:20Z","title":"Upside-Down Reinforcement Learning for More Interpretable Optimal Control","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-12T18:35:59.785384Z"},"links":{"citing_paper":"/paper/2411.11457"},"observation_digest":"sha256:dda7e25617b72fbf459733dccb8e9396da573745c66e07a1259e77e2e010c175","observation_id":"1ce1ff3d-6701-4dc1-8af7-e86ce1fd4fad","resolution":{"observed_at":"2026-08-12T18:35:59.981068Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:35:59.965077Z","title":null,"venue":null,"work_id":"ece41838-8faf-4be4-8921-da3b3fc9f7bc","year":2002},"citing_paper":{"arxiv_id":"2411.11457","last_updated":"2024-11-18T10:44:20Z","snapshot_observed_at":"2026-08-17T09:25:13.586799Z","submitted_at":"2024-11-18T10:44:20Z","title":"Upside-Down Reinforcement Learning for More Interpretable Optimal Control","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-12T18:35:59.789040Z"},"links":{"citing_paper":"/paper/2411.11457"},"observation_digest":"sha256:35492046c44a0164d58a06d8aa8bbca28a52926891a67bbdb0e2467de42625a1","observation_id":"d4032b09-f706-4d38-8406-cbed089e4fba","resolution":{"observed_at":"2026-08-12T18:35:59.968977Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:35:59.954068Z","title":null,"venue":null,"work_id":"55e79577-cd12-414d-9b98-d3e70e6e46af","year":2021},"citing_paper":{"arxiv_id":"2411.11457","last_updated":"2024-11-18T10:44:20Z","snapshot_observed_at":"2026-08-17T09:25:13.586799Z","submitted_at":"2024-11-18T10:44:20Z","title":"Upside-Down Reinforcement Learning for More Interpretable Optimal Control","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-12T18:35:59.792631Z"},"links":{"citing_paper":"/paper/2411.11457"},"observation_digest":"sha256:466a32dcd1db70d9ccadcd3c4d244473f1f8c7b3c8c0f3324db253ba442240d5","observation_id":"5818cd91-1ac4-4f32-9642-6f5116d0e862","resolution":{"observed_at":"2026-08-12T18:35:59.957638Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:35:59.942278Z","title":"R., and Zeng, D","venue":null,"work_id":"a2d07167-327a-4fbc-80ee-cb92bca90938","year":2009},"citing_paper":{"arxiv_id":"2411.11457","last_updated":"2024-11-18T10:44:20Z","snapshot_observed_at":"2026-08-17T09:25:13.586799Z","submitted_at":"2024-11-18T10:44:20Z","title":"Upside-Down Reinforcement Learning for More Interpretable Optimal Control","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-12T18:35:59.796489Z"},"links":{"citing_paper":"/paper/2411.11457"},"observation_digest":"sha256:998fe739054091a3a9740b8d1e44a599ca9d8fd816e24757e464fe4b2a8f5890","observation_id":"684369a4-35c1-47a2-8e24-5e7eecc5e9eb","resolution":{"observed_at":"2026-08-12T18:35:59.946338Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.11457","last_updated":"2024-11-18T10:44:20Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-17T09:25:13.586799Z","submitted_at":"2024-11-18T10:44:20Z","title":"Upside-Down Reinforcement Learning for More Interpretable Optimal Control"},"reference_resolution":{"displayed":50,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":38,"verified_exact":1,"verified_fuzzy":10},"total_outbound_references":50},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 50 of 50 outbound references and 0 inbound Pith citation observations for arXiv:2411.11457."}