{"as_of":"2026-08-10T08:46:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c21c905d36e7e8ac8251c0b9400d41ca42f25501a443e13726f08edcbd19feba","coverage":[{"denominator":67,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":67,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:32:54.400821Z","state":"measured"},{"denominator":67,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":67,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.13672/citation-record","integrity":"/paper/2506.13672/integrity","json":"/paper/2506.13672/citation-record.json","paper":"/paper/2506.13672"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:32:56.188405Z","title":null,"venue":null,"work_id":"bf4d1474-3a62-4f2d-8f49-33146205c0f0","year":2023},"citing_paper":{"arxiv_id":"2506.13672","last_updated":"2025-06-16T16:30:00Z","snapshot_observed_at":"2026-08-09T12:19:47.488554Z","submitted_at":"2025-06-16T16:30:00Z","title":"The Courage to Stop: Overcoming Sunk Cost Fallacy in Deep Reinforcement Learning","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T00:32:50.034330Z"},"links":{"citing_paper":"/paper/2506.13672"},"observation_digest":"sha256:a810d810d6c0e6315439ea4e8d4fedc4c37eb8a473861e812796fba5ae6c7701","observation_id":"088c0f74-fe5f-4416-898a-0d8fa0a6237d","resolution":{"observed_at":"2026-08-07T00:32:56.191659Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:32:56.178988Z","title":null,"venue":null,"work_id":"1cfb89c5-5d0e-4e23-a9c1-fc5185b15fa7","year":1985},"citing_paper":{"arxiv_id":"2506.13672","last_updated":"2025-06-16T16:30:00Z","snapshot_observed_at":"2026-08-09T12:19:47.488554Z","submitted_at":"2025-06-16T16:30:00Z","title":"The Courage to Stop: Overcoming Sunk Cost Fallacy in Deep Reinforcement Learning","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T00:32:50.070341Z"},"links":{"citing_paper":"/paper/2506.13672"},"observation_digest":"sha256:260182a7b2490b8c21e4e7726958a12ac346b518b9f5c7c78ad1b586ae9d83ce","observation_id":"d8740eef-1ef0-4a05-a088-89479bf979f8","resolution":{"observed_at":"2026-08-07T00:32:56.182111Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1606.01540","last_updated":"2016-06-05T17:54:48Z","snapshot_observed_at":"2026-08-09T23:24:21.399948Z","submitted_at":"2016-06-05T17:54:48Z","title":"OpenAI Gym","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.01540","snapshot_observed_at":"2026-08-07T00:32:50.109869Z","title":"Openai gym","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.13672","last_updated":"2025-06-16T16:30:00Z","snapshot_observed_at":"2026-08-09T12:19:47.488554Z","submitted_at":"2025-06-16T16:30:00Z","title":"The Courage to Stop: Overcoming Sunk Cost Fallacy in Deep Reinforcement Learning","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T00:32:50.109869Z"},"links":{"cited_paper":"/paper/1606.01540","citing_paper":"/paper/2506.13672"},"observation_digest":"sha256:f3b1da15f1c68fdbf3aaac1815cf51e5fc7ae76be6e979f24598ef6b1bf0f3d8","observation_id":"ba96e2ff-57cd-4c4e-be56-0657917e6209","resolution":{"observed_at":"2026-08-07T00:32:50.109869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:32:56.169011Z","title":null,"venue":null,"work_id":"692c29ff-e828-4925-a7c3-f9a7de55c24f","year":2021},"citing_paper":{"arxiv_id":"2506.13672","last_updated":"2025-06-16T16:30:00Z","snapshot_observed_at":"2026-08-09T12:19:47.488554Z","submitted_at":"2025-06-16T16:30:00Z","title":"The Courage to Stop: Overcoming Sunk Cost Fallacy in Deep Reinforcement Learning","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T00:32:50.173653Z"},"links":{"citing_paper":"/paper/2506.13672"},"observation_digest":"sha256:60bd4398ee5a52e7a011287efb2bac22537923da0806cf304e78de8431d3a00b","observation_id":"c78b0f73-f7eb-439d-9fa3-82d439d71346","resolution":{"observed_at":"2026-08-07T00:32:56.172292Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:32:56.158460Z","title":null,"venue":null,"work_id":"45978843-6d80-4ceb-b815-c1b6c59efbc0","year":2023},"citing_paper":{"arxiv_id":"2506.13672","last_updated":"2025-06-16T16:30:00Z","snapshot_observed_at":"2026-08-09T12:19:47.488554Z","submitted_at":"2025-06-16T16:30:00Z","title":"The Courage to Stop: Overcoming Sunk Cost Fallacy in Deep Reinforcement Learning","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T00:32:50.232671Z"},"links":{"citing_paper":"/paper/2506.13672"},"observation_digest":"sha256:dea81969f301e0d646daa2c9f561789560601851f78b2d6a65cfec5e7b70650d","observation_id":"94e30e18-13d6-4818-b1e4-163f389d09a6","resolution":{"observed_at":"2026-08-07T00:32:56.161746Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:32:56.148786Z","title":null,"venue":null,"work_id":"16cf4a1d-809b-458a-ac4b-e6151c6a0d5d","year":2024},"citing_paper":{"arxiv_id":"2506.13672","last_updated":"2025-06-16T16:30:00Z","snapshot_observed_at":"2026-08-09T12:19:47.488554Z","submitted_at":"2025-06-16T16:30:00Z","title":"The Courage to Stop: Overcoming Sunk Cost Fallacy in Deep Reinforcement Learning","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T00:32:50.284609Z"},"links":{"citing_paper":"/paper/2506.13672"},"observation_digest":"sha256:ed16b5f8595b3d50706baf68cfce73b480f2f5714acec10044f56a009c29ff72","observation_id":"a084e66b-bf25-4ca5-b7ef-e03e92b9180e","resolution":{"observed_at":"2026-08-07T00:32:56.151864Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.00986","last_updated":"2022-07-03T08:52:40Z","snapshot_observed_at":"2026-07-06T13:27:14.879012Z","submitted_at":"2022-07-03T08:52:40Z","title":"Stabilizing Off-Policy Deep Reinforcement Learning from Pixels","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.00986","snapshot_observed_at":"2026-08-07T00:32:50.368740Z","title":"J., Roberts, S., and Celiktutan, O","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.13672","last_updated":"2025-06-16T16:30:00Z","snapshot_observed_at":"2026-08-09T12:19:47.488554Z","submitted_at":"2025-06-16T16:30:00Z","title":"The Courage to Stop: Overcoming Sunk Cost Fallacy in Deep Reinforcement Learning","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T00:32:50.368740Z"},"links":{"cited_paper":"/paper/2207.00986","citing_paper":"/paper/2506.13672"},"observation_digest":"sha256:1d639522df71935a4b371458d5e186a8f63130cbdcb8fcb84d112b5db6b33f61","observation_id":"ac4175c7-aa18-49a8-8509-72ac5a37170c","resolution":{"observed_at":"2026-08-07T00:32:50.368740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.05982","last_updated":"2021-03-18T03:42:07Z","snapshot_observed_at":"2026-07-06T10:32:46.366651Z","submitted_at":"2021-01-15T06:25:58Z","title":"Randomized Ensembled Double Q-Learning: Learning Fast Without a Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.05982","snapshot_observed_at":"2026-08-07T00:32:50.412668Z","title":"Randomized ensembled double q-learning: Learning fast without a model","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.13672","last_updated":"2025-06-16T16:30:00Z","snapshot_observed_at":"2026-08-09T12:19:47.488554Z","submitted_at":"2025-06-16T16:30:00Z","title":"The Courage to Stop: Overcoming Sunk Cost Fallacy in Deep Reinforcement Learning","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T00:32:50.412668Z"},"links":{"cited_paper":"/paper/2101.05982","citing_paper":"/paper/2506.13672"},"observation_digest":"sha256:528aa080777c3f9d7598a5f2c3f3c0f44c12093432d311944ea8fa853a0f414d","observation_id":"b58b6687-ec6e-4d18-b8aa-6fc75da5b71c","resolution":{"observed_at":"2026-08-07T00:32:50.412668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.05056","last_updated":"2022-08-16T17:01:57Z","snapshot_observed_at":"2026-07-06T13:40:27.644738Z","submitted_at":"2022-08-09T22:00:28Z","title":"Model-Free Generative Replay for Lifelong Reinforcement Learning: Application to Starcraft-2","version":2},"cited_work":{"arxiv_id":"2208.05056","doi":null,"metadata_source":"pith","pith_arxiv_id":"2208.05056","snapshot_observed_at":"2026-08-07T00:32:55.769785Z","title":"Model-Free Generative Replay for Lifelong Reinforcement Learning: Application to Starcraft-2","venue":"cs.LG","work_id":"63b69e19-e646-44df-a480-8860ca9d2203","year":2022},"citing_paper":{"arxiv_id":"2506.13672","last_updated":"2025-06-16T16:30:00Z","snapshot_observed_at":"2026-08-09T12:19:47.488554Z","submitted_at":"2025-06-16T16:30:00Z","title":"The Courage to Stop: Overcoming Sunk Cost Fallacy in Deep Reinforcement Learning","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T00:32:50.489700Z"},"links":{"cited_paper":"/paper/2208.05056","citing_paper":"/paper/2506.13672"},"observation_digest":"sha256:b5aa06011edca0014e03cde854015bd8fb5ed1ba6286f4591ca7a87956a02985","observation_id":"47f52821-2c7f-4b10-a141-14f7bd75a73f","resolution":{"observed_at":"2026-08-07T00:32:55.773730Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1371/journal.pone.0209900","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":null,"venue":"PLoS ONE","work_id":"9d50dc75-b7d6-46ed-8dfa-ac665dd413fe","year":2019},"citing_paper":{"arxiv_id":"2506.13672","last_updated":"2025-06-16T16:30:00Z","snapshot_observed_at":"2026-08-09T12:19:47.488554Z","submitted_at":"2025-06-16T16:30:00Z","title":"The Courage to Stop: Overcoming Sunk Cost Fallacy in Deep Reinforcement Learning","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T00:32:50.552848Z"},"links":{"citing_paper":"/paper/2506.13672"},"observation_digest":"sha256:c6abf974122dc56179788365988e84f49578c811a1c52b8846044180d47d8d9c","observation_id":"134041a6-9e97-48bb-8d6f-ba2341c7ff5f","resolution":{"observed_at":"2026-08-07T00:32:54.925914Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:32:50.592830Z","title":"G., and Courville, A","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.13672","last_updated":"2025-06-16T16:30:00Z","snapshot_observed_at":"2026-08-09T12:19:47.488554Z","submitted_at":"2025-06-16T16:30:00Z","title":"The Courage to Stop: Overcoming Sunk Cost Fallacy in Deep Reinforcement Learning","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T00:32:50.592830Z"},"links":{"citing_paper":"/paper/2506.13672"},"observation_digest":"sha256:c49e55341f21b09b2eaf98d9c10db43f6bb29b9e65f5aa6865d5d1606d9b08c7","observation_id":"a8db4646-1acd-404e-87ea-702597f337cb","resolution":{"observed_at":"2026-08-07T00:32:50.592830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"file/2640539","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:32:55.753541Z","title":"W., Subramanian, J., and Ghassemi, M","venue":null,"work_id":"43471407-37ec-4fcc-a7e3-91c0ada9d721","year":2021},"citing_paper":{"arxiv_id":"2506.13672","last_updated":"2025-06-16T16:30:00Z","snapshot_observed_at":"2026-08-09T12:19:47.488554Z","submitted_at":"2025-06-16T16:30:00Z","title":"The Courage to Stop: Overcoming Sunk Cost Fallacy in Deep Reinforcement Learning","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T00:32:50.628887Z"},"links":{"citing_paper":"/paper/2506.13672"},"observation_digest":"sha256:69e845771d2fc2f5b64056bf6c24d69fecf6cfe2cb9580ea115ec7dd6bac6e83","observation_id":"74eb255d-4dae-4ba4-9b9c-1872bf0fcfcd","resolution":{"observed_at":"2026-08-07T00:32:55.758573Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:32:50.703013Z","title":"Revisiting fundamentals of experience replay","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.13672","last_updated":"2025-06-16T16:30:00Z","snapshot_observed_at":"2026-08-09T12:19:47.488554Z","submitted_at":"2025-06-16T16:30:00Z","title":"The Courage to Stop: Overcoming Sunk Cost Fallacy in Deep Reinforcement Learning","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T00:32:50.703013Z"},"links":{"citing_paper":"/paper/2506.13672"},"observation_digest":"sha256:fb100d3369c4da556dd5a22b4d9b12c43210895f69e08e78e92a43f3d8044250","observation_id":"67b3ad1d-71b8-4f47-973f-7ce034d107c7","resolution":{"observed_at":"2026-08-07T00:32:50.703013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:32:50.764866Z","title":"Addressing function approximation error in actor-critic methods","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.13672","last_updated":"2025-06-16T16:30:00Z","snapshot_observed_at":"2026-08-09T12:19:47.488554Z","submitted_at":"2025-06-16T16:30:00Z","title":"The Courage to Stop: Overcoming Sunk Cost Fallacy in Deep Reinforcement Learning","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T00:32:50.764866Z"},"links":{"citing_paper":"/paper/2506.13672"},"observation_digest":"sha256:f09e3ef9280c21a2e6d8e1e7d3a2f2f8f93b26830bdd1dffd1f8b42a1ed87328","observation_id":"b23c158e-46a9-4aa9-b942-a735050d9861","resolution":{"observed_at":"2026-08-07T00:32:50.764866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:32:50.832637Z","title":"Soft actor-critic: Off-policy maximum entropy deep reinforcement learning with a stochastic actor","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.13672","last_updated":"2025-06-16T16:30:00Z","snapshot_observed_at":"2026-08-09T12:19:47.488554Z","submitted_at":"2025-06-16T16:30:00Z","title":"The Courage to Stop: Overcoming Sunk Cost Fallacy in Deep Reinforcement Learning","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T00:32:50.832637Z"},"links":{"citing_paper":"/paper/2506.13672"},"observation_digest":"sha256:f17a0536c62d2b6a2db339b8c8bd05b1e0d23c0bfc954da1bfeb22a0f495bb2b","observation_id":"c08bb5d9-d454-446f-b43f-21835d58dad6","resolution":{"observed_at":"2026-08-07T00:32:50.832637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1016/j.joep.2016.12.001","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"Sunk-cost fallacy and cognitive ability in individual decision-making","venue":"Journal of Economic Psychology","work_id":"9efefa53-229f-4bf6-9749-efcf7dc7841b","year":2017},"citing_paper":{"arxiv_id":"2506.13672","last_updated":"2025-06-16T16:30:00Z","snapshot_observed_at":"2026-08-09T12:19:47.488554Z","submitted_at":"2025-06-16T16:30:00Z","title":"The Courage to Stop: Overcoming Sunk Cost Fallacy in Deep Reinforcement Learning","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T00:32:50.905906Z"},"links":{"citing_paper":"/paper/2506.13672"},"observation_digest":"sha256:3614c8dc94a47bde51087205e0619c8628753e2f0643a7acfbfc7c9e7d629494","observation_id":"61054b92-983b-4b0b-831e-0dc697467c82","resolution":{"observed_at":"2026-08-07T00:32:54.706719Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:32:56.113352Z","title":"R., Millman, K","venue":null,"work_id":"890d34b3-a8fc-4485-92d4-29645dfd98ff","year":2020},"citing_paper":{"arxiv_id":"2506.13672","last_updated":"2025-06-16T16:30:00Z","snapshot_observed_at":"2026-08-09T12:19:47.488554Z","submitted_at":"2025-06-16T16:30:00Z","title":"The Courage to Stop: Overcoming Sunk Cost Fallacy in Deep Reinforcement Learning","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T00:32:50.926428Z"},"links":{"citing_paper":"/paper/2506.13672"},"observation_digest":"sha256:3eab32545ba636eb7eba0636c1912bac2c1d22f7922645800c83731ac5cfda30","observation_id":"234a0dae-0fd4-42b5-a57c-451e32a7c932","resolution":{"observed_at":"2026-08-07T00:32:56.116543Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:32:56.104558Z","title":"Double q-learning","venue":null,"work_id":"8650944d-c301-491d-9b3d-9f4ffb0410c3","year":2010},"citing_paper":{"arxiv_id":"2506.13672","last_updated":"2025-06-16T16:30:00Z","snapshot_observed_at":"2026-08-09T12:19:47.488554Z","submitted_at":"2025-06-16T16:30:00Z","title":"The Courage to Stop: Overcoming Sunk Cost Fallacy in Deep Reinforcement Learning","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T00:32:51.025987Z"},"links":{"citing_paper":"/paper/2506.13672"},"observation_digest":"sha256:d7c3d8f9300e3a4711b4db9d1ff728cdb9e769e740dcfed18bb6979959775c87","observation_id":"cf7f6777-c012-435d-ab6e-bb8e2237927d","resolution":{"observed_at":"2026-08-07T00:32:56.107696Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.02034","last_updated":"2022-03-16T13:38:46Z","snapshot_observed_at":"2026-08-08T23:30:41.427380Z","submitted_at":"2021-10-05T13:28:11Z","title":"Dropout Q-Functions for Doubly Efficient Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.02034","snapshot_observed_at":"2026-08-07T00:32:51.089069Z","title":"Dropout q-functions for doubly efficient reinforcement learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.13672","last_updated":"2025-06-16T16:30:00Z","snapshot_observed_at":"2026-08-09T12:19:47.488554Z","submitted_at":"2025-06-16T16:30:00Z","title":"The Courage to Stop: Overcoming Sunk Cost Fallacy in Deep Reinforcement Learning","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T00:32:51.089069Z"},"links":{"cited_paper":"/paper/2110.02034","citing_paper":"/paper/2506.13672"},"observation_digest":"sha256:0f7fa87d5f7746d19c233ce3ffb7203181ec6f0433728189b7e0f205dc8746f8","observation_id":"962346cb-77aa-4e31-a6e4-c439b653c794","resolution":{"observed_at":"2026-08-07T00:32:51.089069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.13002","last_updated":"2023-03-23T02:51:50Z","snapshot_observed_at":"2026-08-10T05:18:35.198119Z","submitted_at":"2023-03-23T02:51:50Z","title":"Planning Goals for Exploration","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.13002","snapshot_observed_at":"2026-08-07T00:32:51.133496Z","title":"S., Chang, R., Rybkin, O., and Jayaraman, D","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13672","last_updated":"2025-06-16T16:30:00Z","snapshot_observed_at":"2026-08-09T12:19:47.488554Z","submitted_at":"2025-06-16T16:30:00Z","title":"The Courage to Stop: Overcoming Sunk Cost Fallacy in Deep Reinforcement Learning","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T00:32:51.133496Z"},"links":{"cited_paper":"/paper/2303.13002","citing_paper":"/paper/2506.13672"},"observation_digest":"sha256:affbfaddbc7d557a52d2b3387bbe8711b5db251b276e92b0390e43574a9bb356","observation_id":"30c170d8-8f14-4a6c-8741-82a3045d317f","resolution":{"observed_at":"2026-08-07T00:32:51.133496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1705.08245","last_updated":"2017-05-29T14:24:08Z","snapshot_observed_at":"2026-07-06T05:43:52.691426Z","submitted_at":"2017-05-23T13:36:00Z","title":"Enhanced Experience Replay Generation for Efficient Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.08245","snapshot_observed_at":"2026-08-07T00:32:51.201826Z","title":"Enhanced experience replay generation for efficient reinforcement learning","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.13672","last_updated":"2025-06-16T16:30:00Z","snapshot_observed_at":"2026-08-09T12:19:47.488554Z","submitted_at":"2025-06-16T16:30:00Z","title":"The Courage to Stop: Overcoming Sunk Cost Fallacy in Deep Reinforcement Learning","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T00:32:51.201826Z"},"links":{"cited_paper":"/paper/1705.08245","citing_paper":"/paper/2506.13672"},"observation_digest":"sha256:4ee51f8ea90147fb8f9c9f8e390a99a9c33f7d80ce51af7a21626626b831de95","observation_id":"0b6767b6-f2ed-4dfd-8933-e080872a10b3","resolution":{"observed_at":"2026-08-07T00:32:51.201826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:32:56.095260Z","title":null,"venue":null,"work_id":"9a3f4872-23b0-4bd9-8219-bc0704338e84","year":2007},"citing_paper":{"arxiv_id":"2506.13672","last_updated":"2025-06-16T16:30:00Z","snapshot_observed_at":"2026-08-09T12:19:47.488554Z","submitted_at":"2025-06-16T16:30:00Z","title":"The Courage to Stop: Overcoming Sunk Cost Fallacy in Deep Reinforcement Learning","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T00:32:51.236555Z"},"links":{"citing_paper":"/paper/2506.13672"},"observation_digest":"sha256:e611a7a50df742fa67172acb08d8624d2e2908c3aafb0cabcb1c30f10a299c15","observation_id":"a7febbd2-a0e6-47f6-8055-a046938b0574","resolution":{"observed_at":"2026-08-07T00:32:56.098144Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:32:56.086206Z","title":"An investigation of generative replay in deep reinforcement learning","venue":null,"work_id":"05c2f9ac-9e49-414f-8891-1eb9738543b6","year":2021},"citing_paper":{"arxiv_id":"2506.13672","last_updated":"2025-06-16T16:30:00Z","snapshot_observed_at":"2026-08-09T12:19:47.488554Z","submitted_at":"2025-06-16T16:30:00Z","title":"The Courage to Stop: Overcoming Sunk Cost Fallacy in Deep Reinforcement Learning","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T00:32:51.264341Z"},"links":{"citing_paper":"/paper/2506.13672"},"observation_digest":"sha256:042372a69b378bec2beedc24172babebff6a545187630f7249b3da506b8a9ea5","observation_id":"a28efe13-186d-491b-926d-7db7514d8bb1","resolution":{"observed_at":"2026-08-07T00:32:56.089516Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.05664","last_updated":"2023-01-30T16:08:48Z","snapshot_observed_at":"2026-08-10T03:08:15.096766Z","submitted_at":"2023-01-13T17:01:58Z","title":"Risk Sensitive Dead-end Identification in Safety-Critical Offline Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2301.05664","doi":null,"metadata_source":"pith","pith_arxiv_id":"2301.05664","snapshot_observed_at":"2026-08-07T00:32:55.631685Z","title":"Risk Sensitive Dead-end Identification in Safety-Critical Offline Reinforcement Learning","venue":"cs.LG","work_id":"324d0a4b-3824-41c4-920c-9a37b510c3b3","year":2023},"citing_paper":{"arxiv_id":"2506.13672","last_updated":"2025-06-16T16:30:00Z","snapshot_observed_at":"2026-08-09T12:19:47.488554Z","submitted_at":"2025-06-16T16:30:00Z","title":"The Courage to Stop: Overcoming Sunk Cost Fallacy in Deep Reinforcement Learning","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T00:32:51.310272Z"},"links":{"cited_paper":"/paper/2301.05664","citing_paper":"/paper/2506.13672"},"observation_digest":"sha256:5e1debd3e877d367272079343bc06d105f4f84cd020d4b0e9cce81a6bdf818b7","observation_id":"f8429033-e01f-4244-9be0-55bba015ae5e","resolution":{"observed_at":"2026-08-07T00:32:55.635890Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-07T00:32:51.372728Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.13672","last_updated":"2025-06-16T16:30:00Z","snapshot_observed_at":"2026-08-09T12:19:47.488554Z","submitted_at":"2025-06-16T16:30:00Z","title":"The Courage to Stop: Overcoming Sunk Cost Fallacy in Deep Reinforcement Learning","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T00:32:51.372728Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2506.13672"},"observation_digest":"sha256:67c7a1b33b59454bfe7297d4ca1445e503ae8e6a8a11f172c76afff02d9c426b","observation_id":"f931b24d-da63-42ea-8c8b-e07459ba2322","resolution":{"observed_at":"2026-08-07T00:32:51.372728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:32:56.075254Z","title":"CURL : Contrastive unsupervised representations for reinforcement learning","venue":null,"work_id":"eabcaeef-1717-43e6-a051-2969b1a8839e","year":2020},"citing_paper":{"arxiv_id":"2506.13672","last_updated":"2025-06-16T16:30:00Z","snapshot_observed_at":"2026-08-09T12:19:47.488554Z","submitted_at":"2025-06-16T16:30:00Z","title":"The Courage to Stop: Overcoming Sunk Cost Fallacy in Deep Reinforcement Learning","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T00:32:51.422423Z"},"links":{"citing_paper":"/paper/2506.13672"},"observation_digest":"sha256:b368b4fc9e723428bc8f0684e5f16e90147f81e10ec82bbd4cfde02bf58e4ee8","observation_id":"7f149a22-56a5-47e0-b243-32fd713826ff","resolution":{"observed_at":"2026-08-07T00:32:56.080060Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.05490","last_updated":"2022-03-16T08:15:15Z","snapshot_observed_at":"2026-08-09T15:52:09.585327Z","submitted_at":"2021-09-12T11:26:27Z","title":"HyAR: Addressing Discrete-Continuous Action Reinforcement Learning via Hybrid Action Representation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.05490","snapshot_observed_at":"2026-08-07T00:32:51.484896Z","title":"Hyar: Addressing discrete-continuous action reinforcement learning via hybrid action representation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.13672","last_updated":"2025-06-16T16:30:00Z","snapshot_observed_at":"2026-08-09T12:19:47.488554Z","submitted_at":"2025-06-16T16:30:00Z","title":"The Courage to Stop: Overcoming Sunk Cost Fallacy in Deep Reinforcement Learning","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T00:32:51.484896Z"},"links":{"cited_paper":"/paper/2109.05490","citing_paper":"/paper/2506.13672"},"observation_digest":"sha256:e9f51cd7b6675954c3427e894a8c457517e75c1783afea128f0d5d040d77f40c","observation_id":"4eba7925-a8d6-498a-bb0c-2245d0a24203","resolution":{"observed_at":"2026-08-07T00:32:51.484896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1509.02971","last_updated":"2019-07-05T10:47:27Z","snapshot_observed_at":"2026-07-06T04:29:24.362640Z","submitted_at":"2015-09-09T23:01:36Z","title":"Continuous control with deep reinforcement learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1509.02971","snapshot_observed_at":"2026-08-07T00:32:51.581844Z","title":"P., Hunt, J","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.13672","last_updated":"2025-06-16T16:30:00Z","snapshot_observed_at":"2026-08-09T12:19:47.488554Z","submitted_at":"2025-06-16T16:30:00Z","title":"The Courage to Stop: Overcoming Sunk Cost Fallacy in Deep Reinforcement Learning","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T00:32:51.581844Z"},"links":{"cited_paper":"/paper/1509.02971","citing_paper":"/paper/2506.13672"},"observation_digest":"sha256:c662d6091be378974a003ca54235e0920b28a948cf25941d7a92b431608f58e8","observation_id":"9027ad0e-f8f2-4657-a7be-1ecfbd57f57a","resolution":{"observed_at":"2026-08-07T00:32:51.581844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:32:56.065910Z","title":"Unlock the intermittent control ability of model free reinforcement learning","venue":null,"work_id":"4d3d63de-6508-4e36-8159-23b8c7903101","year":null},"citing_paper":{"arxiv_id":"2506.13672","last_updated":"2025-06-16T16:30:00Z","snapshot_observed_at":"2026-08-09T12:19:47.488554Z","submitted_at":"2025-06-16T16:30:00Z","title":"The Courage to Stop: Overcoming Sunk Cost Fallacy in Deep Reinforcement Learning","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T00:32:51.627229Z"},"links":{"citing_paper":"/paper/2506.13672"},"observation_digest":"sha256:71b5bce195c3cf1b2bbebe3023d049eb8657607c8f8786ee03033d80a31f67b7","observation_id":"8ca1f07c-c3b9-4933-8c83-ec8274f9d30f","resolution":{"observed_at":"2026-08-07T00:32:56.069185Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:32:56.056641Z","title":null,"venue":null,"work_id":"e5da36ac-9e6f-41ac-b56e-2c784b603d4d","year":2025},"citing_paper":{"arxiv_id":"2506.13672","last_updated":"2025-06-16T16:30:00Z","snapshot_observed_at":"2026-08-09T12:19:47.488554Z","submitted_at":"2025-06-16T16:30:00Z","title":"The Courage to Stop: Overcoming Sunk Cost Fallacy in Deep Reinforcement Learning","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T00:32:51.676803Z"},"links":{"citing_paper":"/paper/2506.13672"},"observation_digest":"sha256:1416e635c836ea5c18ad88a4d9f02264a63a3d8c7dfcc579d0856b1baf2ce426","observation_id":"66a22057-2102-44d2-91ba-467c9ce178c7","resolution":{"observed_at":"2026-08-07T00:32:56.060067Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:32:56.046531Z","title":"W., and Parker-Holder, J","venue":null,"work_id":"0769f8df-7b80-4e67-becd-583ab226c080","year":2024},"citing_paper":{"arxiv_id":"2506.13672","last_updated":"2025-06-16T16:30:00Z","snapshot_observed_at":"2026-08-09T12:19:47.488554Z","submitted_at":"2025-06-16T16:30:00Z","title":"The Courage to Stop: Overcoming Sunk Cost Fallacy in Deep Reinforcement Learning","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T00:32:51.718788Z"},"links":{"citing_paper":"/paper/2506.13672"},"observation_digest":"sha256:a8870926d4dee445a8b28059e1cade582473fc326e3b5b7bf5d7dee072596888","observation_id":"777ddf33-8dd3-45f6-841b-b27fa644f0c7","resolution":{"observed_at":"2026-08-07T00:32:56.049548Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.07418","last_updated":"2024-05-19T19:04:31Z","snapshot_observed_at":"2026-08-05T20:04:39.463011Z","submitted_at":"2023-10-11T12:05:34Z","title":"Revisiting Plasticity in Visual Reinforcement Learning: Data, Modules and Training Stages","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.07418","snapshot_observed_at":"2026-08-07T00:32:51.760568Z","title":"Revisiting plasticity in visual reinforcement learning: Data, modules and training stages","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13672","last_updated":"2025-06-16T16:30:00Z","snapshot_observed_at":"2026-08-09T12:19:47.488554Z","submitted_at":"2025-06-16T16:30:00Z","title":"The Courage to Stop: Overcoming Sunk Cost Fallacy in Deep Reinforcement Learning","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T00:32:51.760568Z"},"links":{"cited_paper":"/paper/2310.07418","citing_paper":"/paper/2506.13672"},"observation_digest":"sha256:6d460116abcfbd7409fc4a97c63771199b6447de999b169bd836b3ff21793bf1","observation_id":"5a3c5aca-0cec-4191-a7ba-ccd0c65ce5ea","resolution":{"observed_at":"2026-08-07T00:32:51.760568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:32:56.036528Z","title":"Online reinforcement learning with uncertain episode lengths","venue":null,"work_id":"eacd50fa-27c6-4e2e-9118-fb04be411d94","year":2023},"citing_paper":{"arxiv_id":"2506.13672","last_updated":"2025-06-16T16:30:00Z","snapshot_observed_at":"2026-08-09T12:19:47.488554Z","submitted_at":"2025-06-16T16:30:00Z","title":"The Courage to Stop: Overcoming Sunk Cost Fallacy in Deep Reinforcement Learning","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T00:32:51.823709Z"},"links":{"citing_paper":"/paper/2506.13672"},"observation_digest":"sha256:a328472fc675d9ebe3b3332cddb9392a1f1226e5056fd8a17b4c2f43c0e3634f","observation_id":"914aae6e-5090-4352-802d-356c8f4d15ef","resolution":{"observed_at":"2026-08-07T00:32:56.040234Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:32:56.025781Z","title":"Tactical optimism and pessimism for deep reinforcement learning","venue":null,"work_id":"53868f1a-e39f-4e0c-bc17-390896026709","year":2021},"citing_paper":{"arxiv_id":"2506.13672","last_updated":"2025-06-16T16:30:00Z","snapshot_observed_at":"2026-08-09T12:19:47.488554Z","submitted_at":"2025-06-16T16:30:00Z","title":"The Courage to Stop: Overcoming Sunk Cost Fallacy in Deep Reinforcement Learning","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T00:32:51.877004Z"},"links":{"citing_paper":"/paper/2506.13672"},"observation_digest":"sha256:4d2b21d6afd1922208ef2333e2f9eeb4ea483910356ca00b99e4d021c1813bb4","observation_id":"1bada11b-e190-455f-b112-7defdb9beb3d","resolution":{"observed_at":"2026-08-07T00:32:56.029700Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16158","last_updated":"2024-12-03T08:42:49Z","snapshot_observed_at":"2026-08-07T12:11:17.938787Z","submitted_at":"2024-05-25T09:53:25Z","title":"Bigger, Regularized, Optimistic: scaling for compute and sample-efficient continuous control","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16158","snapshot_observed_at":"2026-08-07T00:32:51.919314Z","title":"Bigger, regularized, optimistic: scaling for compute and sample-efficient continuous control","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13672","last_updated":"2025-06-16T16:30:00Z","snapshot_observed_at":"2026-08-09T12:19:47.488554Z","submitted_at":"2025-06-16T16:30:00Z","title":"The Courage to Stop: Overcoming Sunk Cost Fallacy in Deep Reinforcement Learning","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T00:32:51.919314Z"},"links":{"cited_paper":"/paper/2405.16158","citing_paper":"/paper/2506.13672"},"observation_digest":"sha256:758d98e1457a3e35c39d5daf301837ba3f81a1ed66f8504e04b3c8ac88ccbc0b","observation_id":"0d1d9e27-5aed-4b82-a953-88d50f1a3aeb","resolution":{"observed_at":"2026-08-07T00:32:51.919314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:32:56.013196Z","title":"The primacy bias in deep reinforcement learning","venue":null,"work_id":"a94c0e68-f3fa-4209-a047-c87c2d825f8d","year":2022},"citing_paper":{"arxiv_id":"2506.13672","last_updated":"2025-06-16T16:30:00Z","snapshot_observed_at":"2026-08-09T12:19:47.488554Z","submitted_at":"2025-06-16T16:30:00Z","title":"The Courage to Stop: Overcoming Sunk Cost Fallacy in Deep Reinforcement Learning","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T00:32:51.968328Z"},"links":{"citing_paper":"/paper/2506.13672"},"observation_digest":"sha256:127f717039a95691cb14cbe2264b9e8898711f5d19d028c2cc0e73ba521d07f0","observation_id":"070c5cfe-e979-4beb-bcc9-a55dbd64ec20","resolution":{"observed_at":"2026-08-07T00:32:56.016950Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:32:56.000911Z","title":null,"venue":null,"work_id":"98027dd0-8e15-4029-ab27-15ee67a3253a","year":2024},"citing_paper":{"arxiv_id":"2506.13672","last_updated":"2025-06-16T16:30:00Z","snapshot_observed_at":"2026-08-09T12:19:47.488554Z","submitted_at":"2025-06-16T16:30:00Z","title":"The Courage to Stop: Overcoming Sunk Cost Fallacy in Deep Reinforcement Learning","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T00:32:52.017309Z"},"links":{"citing_paper":"/paper/2506.13672"},"observation_digest":"sha256:afce849922ec470de893a0596f60a5358d45dec0577fa588e3ed7db892b88488","observation_id":"e8eb03d9-2105-45a2-bbaa-990e2397a778","resolution":{"observed_at":"2026-08-07T00:32:56.004767Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:32:55.988772Z","title":null,"venue":null,"work_id":"5af7ddc0-7e25-42e0-a7ce-d15925b670b6","year":2024},"citing_paper":{"arxiv_id":"2506.13672","last_updated":"2025-06-16T16:30:00Z","snapshot_observed_at":"2026-08-09T12:19:47.488554Z","submitted_at":"2025-06-16T16:30:00Z","title":"The Courage to Stop: Overcoming Sunk Cost Fallacy in Deep Reinforcement Learning","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T00:32:52.051990Z"},"links":{"citing_paper":"/paper/2506.13672"},"observation_digest":"sha256:c7b5141d56ce0b09f4f7e6175329099070cf54351b13e6d7ab259d51b3b3d523","observation_id":"c0fc6932-682d-482a-bfc2-4920c266cc36","resolution":{"observed_at":"2026-08-07T00:32:55.992729Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:32:52.099844Z","title":null,"venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2506.13672","last_updated":"2025-06-16T16:30:00Z","snapshot_observed_at":"2026-08-09T12:19:47.488554Z","submitted_at":"2025-06-16T16:30:00Z","title":"The Courage to Stop: Overcoming Sunk Cost Fallacy in Deep Reinforcement Learning","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T00:32:52.099844Z"},"links":{"citing_paper":"/paper/2506.13672"},"observation_digest":"sha256:39528c0a959497cd59be4d96ed53ea18b704c581292bcc1bb6624df8425c47a9","observation_id":"8668d5d8-ef85-4d7b-8892-2c64c2f76568","resolution":{"observed_at":"2026-08-07T00:32:52.099844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1903.05926","last_updated":"2019-09-08T07:41:39Z","snapshot_observed_at":"2026-07-06T07:39:13.754069Z","submitted_at":"2019-03-14T11:54:13Z","title":"Reinforcement Learning with Dynamic Boltzmann Softmax Updates","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1903.05926","snapshot_observed_at":"2026-08-07T00:32:52.160250Z","title":"Reinforcement learning with dynamic boltzmann softmax updates","venue":null,"work_id":null,"year":1903},"citing_paper":{"arxiv_id":"2506.13672","last_updated":"2025-06-16T16:30:00Z","snapshot_observed_at":"2026-08-09T12:19:47.488554Z","submitted_at":"2025-06-16T16:30:00Z","title":"The Courage to Stop: Overcoming Sunk Cost Fallacy in Deep Reinforcement Learning","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T00:32:52.160250Z"},"links":{"cited_paper":"/paper/1903.05926","citing_paper":"/paper/2506.13672"},"observation_digest":"sha256:8149e709616e0b6e31374765e88756c650cc236deb16fc7af8ab95f9b4457413","observation_id":"65a0b996-78b1-4ed1-a3ea-e92db6cdf013","resolution":{"observed_at":"2026-08-07T00:32:52.160250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:32:55.977911Z","title":"Softmax deep double deterministic policy gradients","venue":null,"work_id":"c3a5c701-8adf-42a0-84bc-ce433ac5f55f","year":2020},"citing_paper":{"arxiv_id":"2506.13672","last_updated":"2025-06-16T16:30:00Z","snapshot_observed_at":"2026-08-09T12:19:47.488554Z","submitted_at":"2025-06-16T16:30:00Z","title":"The Courage to Stop: Overcoming Sunk Cost Fallacy in Deep Reinforcement Learning","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T00:32:52.192637Z"},"links":{"citing_paper":"/paper/2506.13672"},"observation_digest":"sha256:656adf0463bcbedcda3844e9a12a0e9573fba41070f1475dbd4ecc0e770dcedf","observation_id":"9660b867-6b68-419b-88d0-fd77ae2cf9f2","resolution":{"observed_at":"2026-08-07T00:32:55.981193Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:32:55.966761Z","title":"Regularized softmax deep multi-agent q-learning","venue":null,"work_id":"dc99177d-11cc-499a-957c-951a3e3fc7fa","year":2021},"citing_paper":{"arxiv_id":"2506.13672","last_updated":"2025-06-16T16:30:00Z","snapshot_observed_at":"2026-08-09T12:19:47.488554Z","submitted_at":"2025-06-16T16:30:00Z","title":"The Courage to Stop: Overcoming Sunk Cost Fallacy in Deep Reinforcement Learning","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T00:32:52.230814Z"},"links":{"citing_paper":"/paper/2506.13672"},"observation_digest":"sha256:e1fe49584712f6ae21b2e90681ce11cb9317ee96bd376589eb60013472ad281d","observation_id":"fd8f489c-b566-440a-88c7-cf0253156be3","resolution":{"observed_at":"2026-08-07T00:32:55.970541Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:32:55.954966Z","title":"Time limits in reinforcement learning","venue":null,"work_id":"36df8e9d-2a6e-46e8-b832-9ed00c57e4d8","year":2018},"citing_paper":{"arxiv_id":"2506.13672","last_updated":"2025-06-16T16:30:00Z","snapshot_observed_at":"2026-08-09T12:19:47.488554Z","submitted_at":"2025-06-16T16:30:00Z","title":"The Courage to Stop: Overcoming Sunk Cost Fallacy in Deep Reinforcement Learning","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T00:32:52.321621Z"},"links":{"citing_paper":"/paper/2506.13672"},"observation_digest":"sha256:b5bba478d9dcef00ce00bba961f5c1ced95141855ece450b7b3feb3d45d7616e","observation_id":"5c1641d6-a350-4942-84a0-4fc0f58aa313","resolution":{"observed_at":"2026-08-07T00:32:55.958785Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:32:55.942921Z","title":"A., and Darrell, T","venue":null,"work_id":"226c33e0-5f5d-4092-b57f-a5eaedddd21a","year":2017},"citing_paper":{"arxiv_id":"2506.13672","last_updated":"2025-06-16T16:30:00Z","snapshot_observed_at":"2026-08-09T12:19:47.488554Z","submitted_at":"2025-06-16T16:30:00Z","title":"The Courage to Stop: Overcoming Sunk Cost Fallacy in Deep Reinforcement Learning","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T00:32:52.386837Z"},"links":{"citing_paper":"/paper/2506.13672"},"observation_digest":"sha256:b8ccfef12b8aceb6e25b47b045560b75556fe89face277cef3ac489a15fa327a","observation_id":"a39b91ca-6935-48b4-a1b8-47d17ec83dd5","resolution":{"observed_at":"2026-08-07T00:32:55.947216Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:32:55.930270Z","title":"M., and Restelli, M","venue":null,"work_id":"8009ac41-9e9a-4901-ae0b-a63945cb8038","year":2023},"citing_paper":{"arxiv_id":"2506.13672","last_updated":"2025-06-16T16:30:00Z","snapshot_observed_at":"2026-08-09T12:19:47.488554Z","submitted_at":"2025-06-16T16:30:00Z","title":"The Courage to Stop: Overcoming Sunk Cost Fallacy in Deep Reinforcement Learning","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T00:32:52.430420Z"},"links":{"citing_paper":"/paper/2506.13672"},"observation_digest":"sha256:e6e484e4b78d848505452d72e6df85010d131dd5665a49bbfc181938260a9f67","observation_id":"2986c97b-8c8d-4f18-b235-2c43b089d4f4","resolution":{"observed_at":"2026-08-07T00:32:55.934747Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:32:55.917234Z","title":"M., and Restelli, M","venue":null,"work_id":"d609fa02-505d-4c72-bdd6-ed3abe4bd035","year":2024},"citing_paper":{"arxiv_id":"2506.13672","last_updated":"2025-06-16T16:30:00Z","snapshot_observed_at":"2026-08-09T12:19:47.488554Z","submitted_at":"2025-06-16T16:30:00Z","title":"The Courage to Stop: Overcoming Sunk Cost Fallacy in Deep Reinforcement Learning","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T00:32:52.493835Z"},"links":{"citing_paper":"/paper/2506.13672"},"observation_digest":"sha256:d8db28a0b203c3ad9e2c149b8769133155c53df118cb7ea24e6ebcea07a38ba9","observation_id":"42e3395c-bc25-4354-8cb0-42c32b25495c","resolution":{"observed_at":"2026-08-07T00:32:55.921337Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.12174","last_updated":"2020-02-26T17:15:53Z","snapshot_observed_at":"2026-08-08T01:34:17.837088Z","submitted_at":"2020-02-26T17:15:53Z","title":"Optimistic Exploration even with a Pessimistic Initialisation","version":1},"cited_work":{"arxiv_id":"2002.12174","doi":null,"metadata_source":"pith","pith_arxiv_id":"2002.12174","snapshot_observed_at":"2026-08-07T00:32:55.551567Z","title":"Optimistic Exploration even with a Pessimistic Initialisation","venue":"cs.LG","work_id":"b83ea9e0-b8cb-4011-a6de-2db080e9984a","year":2020},"citing_paper":{"arxiv_id":"2506.13672","last_updated":"2025-06-16T16:30:00Z","snapshot_observed_at":"2026-08-09T12:19:47.488554Z","submitted_at":"2025-06-16T16:30:00Z","title":"The Courage to Stop: Overcoming Sunk Cost Fallacy in Deep Reinforcement Learning","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T00:32:52.586211Z"},"links":{"cited_paper":"/paper/2002.12174","citing_paper":"/paper/2506.13672"},"observation_digest":"sha256:61fedccb5d2f1a07703e2a6aa44a27f8073984b8c6067d4b17c7f7b567bb4b05","observation_id":"ac7e3916-194d-49ab-9420-f5302e4f0da4","resolution":{"observed_at":"2026-08-07T00:32:55.555362Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1511.05952","last_updated":"2016-02-25T17:55:31Z","snapshot_observed_at":"2026-07-06T04:37:00.543211Z","submitted_at":"2015-11-18T20:54:44Z","title":"Prioritized Experience Replay","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1511.05952","snapshot_observed_at":"2026-08-07T00:32:52.629886Z","title":"Prioritized experience replay","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.13672","last_updated":"2025-06-16T16:30:00Z","snapshot_observed_at":"2026-08-09T12:19:47.488554Z","submitted_at":"2025-06-16T16:30:00Z","title":"The Courage to Stop: Overcoming Sunk Cost Fallacy in Deep Reinforcement Learning","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T00:32:52.629886Z"},"links":{"cited_paper":"/paper/1511.05952","citing_paper":"/paper/2506.13672"},"observation_digest":"sha256:4db36e68fd6db3f1540dd5d749f41e3bc863652de575ae5ff87c06632ed617c7","observation_id":"b7cee4a3-ece9-4414-85ac-3e7ec8f782a7","resolution":{"observed_at":"2026-08-07T00:32:52.629886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:32:55.904364Z","title":null,"venue":null,"work_id":"754aea82-0a2d-4bfa-ba8d-260a47706983","year":2023},"citing_paper":{"arxiv_id":"2506.13672","last_updated":"2025-06-16T16:30:00Z","snapshot_observed_at":"2026-08-09T12:19:47.488554Z","submitted_at":"2025-06-16T16:30:00Z","title":"The Courage to Stop: Overcoming Sunk Cost Fallacy in Deep Reinforcement Learning","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T00:32:52.697565Z"},"links":{"citing_paper":"/paper/2506.13672"},"observation_digest":"sha256:753f57eabff8495375a5e22473a3aa75298dede63462daf8f4a7c044ce071349","observation_id":"0e458a88-e4c5-4099-9924-1a5abfd97568","resolution":{"observed_at":"2026-08-07T00:32:55.908081Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:32:52.837429Z","title":"S., and Evci, U","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13672","last_updated":"2025-06-16T16:30:00Z","snapshot_observed_at":"2026-08-09T12:19:47.488554Z","submitted_at":"2025-06-16T16:30:00Z","title":"The Courage to Stop: Overcoming Sunk Cost Fallacy in Deep Reinforcement Learning","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T00:32:52.837429Z"},"links":{"citing_paper":"/paper/2506.13672"},"observation_digest":"sha256:00134864151d18e620a6b90767283a200ffc98a7fac2d4c05b5f1a6d6da95003","observation_id":"e9e3441b-e682-48b6-9f1b-4ea00bcb32b4","resolution":{"observed_at":"2026-08-07T00:32:52.837429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01930","last_updated":"2025-02-26T20:36:25Z","snapshot_observed_at":"2026-07-06T19:26:33.330434Z","submitted_at":"2024-10-02T18:22:45Z","title":"Don't flatten, tokenize! Unlocking the key to SoftMoE's efficacy in deep RL","version":2},"cited_work":{"arxiv_id":"2410.01930","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.01930","snapshot_observed_at":"2026-08-07T00:32:55.416658Z","title":"Don't flatten, tokenize! Unlocking the key to SoftMoE's efficacy in deep RL","venue":"cs.LG","work_id":"ee58dc12-534f-4a1d-bcb4-53440e759128","year":2024},"citing_paper":{"arxiv_id":"2506.13672","last_updated":"2025-06-16T16:30:00Z","snapshot_observed_at":"2026-08-09T12:19:47.488554Z","submitted_at":"2025-06-16T16:30:00Z","title":"The Courage to Stop: Overcoming Sunk Cost Fallacy in Deep Reinforcement Learning","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T00:32:52.902691Z"},"links":{"cited_paper":"/paper/2410.01930","citing_paper":"/paper/2506.13672"},"observation_digest":"sha256:81db0b6e78734099c0d712fa8f7b0105c1fbc2c276ea85ebb273147b48c40d3e","observation_id":"6a35abc8-8d00-4b36-893e-a38fb2906a11","resolution":{"observed_at":"2026-08-07T00:32:55.490510Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:32:55.883206Z","title":"Revisiting the softmax bellman operator: New benefits and new perspective","venue":null,"work_id":"05374d64-c563-4b9a-8c36-e0f260994786","year":2019},"citing_paper":{"arxiv_id":"2506.13672","last_updated":"2025-06-16T16:30:00Z","snapshot_observed_at":"2026-08-09T12:19:47.488554Z","submitted_at":"2025-06-16T16:30:00Z","title":"The Courage to Stop: Overcoming Sunk Cost Fallacy in Deep Reinforcement Learning","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T00:32:52.972733Z"},"links":{"citing_paper":"/paper/2506.13672"},"observation_digest":"sha256:80ab869b4d722b9c4e36d050b33eda9b1627d270ce5bc10dcb298326a5011dee","observation_id":"f4ab1462-9de7-4f2a-8679-bc0723435502","resolution":{"observed_at":"2026-08-07T00:32:55.886519Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:32:55.873179Z","title":"Prioritizing samples in reinforcement learning with reducible loss","venue":null,"work_id":"e0be0e66-dcb1-41a6-bde0-3e56fed17623","year":2023},"citing_paper":{"arxiv_id":"2506.13672","last_updated":"2025-06-16T16:30:00Z","snapshot_observed_at":"2026-08-09T12:19:47.488554Z","submitted_at":"2025-06-16T16:30:00Z","title":"The Courage to Stop: Overcoming Sunk Cost Fallacy in Deep Reinforcement Learning","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-07T00:32:53.084002Z"},"links":{"citing_paper":"/paper/2506.13672"},"observation_digest":"sha256:5ec3db7a215b97f1ed7f6a3d89b3f0d7277b3d05a4cbcd36cab65e32f7fadba8","observation_id":"d90db58a-4793-4d0b-9c9c-9099759ce176","resolution":{"observed_at":"2026-08-07T00:32:55.876288Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.04200","last_updated":"2021-07-09T04:24:40Z","snapshot_observed_at":"2026-07-06T11:27:31.181558Z","submitted_at":"2021-07-09T04:24:40Z","title":"Safe Exploration by Solving Early Terminated MDP","version":1},"cited_work":{"arxiv_id":"2107.04200","doi":null,"metadata_source":"pith","pith_arxiv_id":"2107.04200","snapshot_observed_at":"2026-08-07T00:32:55.251044Z","title":"Safe Exploration by Solving Early Terminated MDP","venue":"cs.LG","work_id":"d609d197-6cda-4dd9-a673-36c388c6560e","year":2021},"citing_paper":{"arxiv_id":"2506.13672","last_updated":"2025-06-16T16:30:00Z","snapshot_observed_at":"2026-08-09T12:19:47.488554Z","submitted_at":"2025-06-16T16:30:00Z","title":"The Courage to Stop: Overcoming Sunk Cost Fallacy in Deep Reinforcement Learning","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-07T00:32:53.197634Z"},"links":{"cited_paper":"/paper/2107.04200","citing_paper":"/paper/2506.13672"},"observation_digest":"sha256:b30f91c5a2d769a0c527f3ae77cd875f001ceae2566c6b3ca9b7dc17e905d154","observation_id":"e6907165-b461-4f4a-ad31-8153b8e506b7","resolution":{"observed_at":"2026-08-07T00:32:55.325475Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1126/science.aar8644","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"sunk costs","venue":"Science","work_id":"18bc1943-8a80-4407-895d-24edb3fe8337","year":2018},"citing_paper":{"arxiv_id":"2506.13672","last_updated":"2025-06-16T16:30:00Z","snapshot_observed_at":"2026-08-09T12:19:47.488554Z","submitted_at":"2025-06-16T16:30:00Z","title":"The Courage to Stop: Overcoming Sunk Cost Fallacy in Deep Reinforcement Learning","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-07T00:32:53.278813Z"},"links":{"citing_paper":"/paper/2506.13672"},"observation_digest":"sha256:2b045b6103393610a0d1cfb75d9bf929864bf7b7cf82bf71530d9161631252de","observation_id":"35d61335-ae2b-479d-abab-982bc9a399e0","resolution":{"observed_at":"2026-08-07T00:32:54.587105Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-01T20:24:08.300098Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.00690","snapshot_observed_at":"2026-08-07T00:32:53.351761Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.13672","last_updated":"2025-06-16T16:30:00Z","snapshot_observed_at":"2026-08-09T12:19:47.488554Z","submitted_at":"2025-06-16T16:30:00Z","title":"The Courage to Stop: Overcoming Sunk Cost Fallacy in Deep Reinforcement Learning","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-07T00:32:53.351761Z"},"links":{"cited_paper":"/paper/1801.00690","citing_paper":"/paper/2506.13672"},"observation_digest":"sha256:640e035a16df8e75094e89acb1a61790434b7023fa93b211530d4143b8a1b3e0","observation_id":"364092c5-6388-4b31-afdc-14272e675950","resolution":{"observed_at":"2026-08-07T00:32:53.351761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.02694","last_updated":"2025-04-14T00:48:47Z","snapshot_observed_at":"2026-07-06T15:50:53.355649Z","submitted_at":"2023-07-05T23:53:55Z","title":"Loss Functions and Metrics in Deep Learning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.02694","snapshot_observed_at":"2026-08-07T00:32:53.432291Z","title":"M., Ramirez-Pedraza, A., Chavez-Urbiola, E","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13672","last_updated":"2025-06-16T16:30:00Z","snapshot_observed_at":"2026-08-09T12:19:47.488554Z","submitted_at":"2025-06-16T16:30:00Z","title":"The Courage to Stop: Overcoming Sunk Cost Fallacy in Deep Reinforcement Learning","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-07T00:32:53.432291Z"},"links":{"cited_paper":"/paper/2307.02694","citing_paper":"/paper/2506.13672"},"observation_digest":"sha256:4d3070bc8087256c13a77273c7d533687066dc34f9b11da17dc3855bf5957af4","observation_id":"6e83b4c8-5af9-4201-9939-05fa456612a6","resolution":{"observed_at":"2026-08-07T00:32:53.432291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:32:55.863753Z","title":"H., Meyers, E","venue":null,"work_id":"5202cc07-b581-4238-869d-7306c4979ae1","year":2019},"citing_paper":{"arxiv_id":"2506.13672","last_updated":"2025-06-16T16:30:00Z","snapshot_observed_at":"2026-08-09T12:19:47.488554Z","submitted_at":"2025-06-16T16:30:00Z","title":"The Courage to Stop: Overcoming Sunk Cost Fallacy in Deep Reinforcement Learning","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-07T00:32:53.623704Z"},"links":{"citing_paper":"/paper/2506.13672"},"observation_digest":"sha256:041bb63f2b1fa2c254ab381b3b0eff864eb5ea28982662ff53a27037058e7d7f","observation_id":"388bbcb7-8741-43ce-a4a1-fe19799cd702","resolution":{"observed_at":"2026-08-07T00:32:55.866665Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:32:55.854057Z","title":"Deep reinforcement learning with double q-learning","venue":null,"work_id":"443239ac-89f8-4cf2-9263-e25520d29d85","year":2016},"citing_paper":{"arxiv_id":"2506.13672","last_updated":"2025-06-16T16:30:00Z","snapshot_observed_at":"2026-08-09T12:19:47.488554Z","submitted_at":"2025-06-16T16:30:00Z","title":"The Courage to Stop: Overcoming Sunk Cost Fallacy in Deep Reinforcement Learning","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-07T00:32:53.697176Z"},"links":{"citing_paper":"/paper/2506.13672"},"observation_digest":"sha256:cf74d90752dc174377a838e827b320115d29e7070caf88109d5847f1418029ea","observation_id":"31640fed-96f4-4f9b-9cd6-58fb38c952ce","resolution":{"observed_at":"2026-08-07T00:32:55.857507Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:32:55.843512Z","title":"and Drake Jr, F","venue":null,"work_id":"bec080d3-8f8b-4406-a8e2-8a68289ce652","year":1995},"citing_paper":{"arxiv_id":"2506.13672","last_updated":"2025-06-16T16:30:00Z","snapshot_observed_at":"2026-08-09T12:19:47.488554Z","submitted_at":"2025-06-16T16:30:00Z","title":"The Courage to Stop: Overcoming Sunk Cost Fallacy in Deep Reinforcement Learning","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-07T00:32:53.713465Z"},"links":{"citing_paper":"/paper/2506.13672"},"observation_digest":"sha256:2a66ca598469adda602dafe96201395df2df5469c3cacda01853e03b69ada775","observation_id":"58976586-1628-4cf5-a242-d26288add4d0","resolution":{"observed_at":"2026-08-07T00:32:55.847097Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.04136","last_updated":"2019-12-09T15:47:27Z","snapshot_observed_at":"2026-08-09T19:14:25.090165Z","submitted_at":"2019-12-09T15:47:27Z","title":"Optimism in Reinforcement Learning with Generalized Linear Function Approximation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.04136","snapshot_observed_at":"2026-08-07T00:32:53.761065Z","title":"S., and Krishnamurthy, A","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2506.13672","last_updated":"2025-06-16T16:30:00Z","snapshot_observed_at":"2026-08-09T12:19:47.488554Z","submitted_at":"2025-06-16T16:30:00Z","title":"The Courage to Stop: Overcoming Sunk Cost Fallacy in Deep Reinforcement Learning","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-07T00:32:53.761065Z"},"links":{"cited_paper":"/paper/1912.04136","citing_paper":"/paper/2506.13672"},"observation_digest":"sha256:73d468ea6bdc42026396fb910fddc566cf1869625257ca51ce24ec1aea97fc48","observation_id":"cc25d49c-21eb-4831-96f8-e5b9a1915127","resolution":{"observed_at":"2026-08-07T00:32:53.761065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19668","last_updated":"2024-02-14T03:56:25Z","snapshot_observed_at":"2026-07-06T16:40:35.590974Z","submitted_at":"2023-10-30T15:50:56Z","title":"DrM: Mastering Visual Reinforcement Learning through Dormant Ratio Minimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.19668","snapshot_observed_at":"2026-08-07T00:32:53.901414Z","title":"Drm: Mastering visual reinforcement learning through dormant ratio minimization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.13672","last_updated":"2025-06-16T16:30:00Z","snapshot_observed_at":"2026-08-09T12:19:47.488554Z","submitted_at":"2025-06-16T16:30:00Z","title":"The Courage to Stop: Overcoming Sunk Cost Fallacy in Deep Reinforcement Learning","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-07T00:32:53.901414Z"},"links":{"cited_paper":"/paper/2310.19668","citing_paper":"/paper/2506.13672"},"observation_digest":"sha256:3d3e564ae97b5fcf2a8fc28256a80f5c23950e9619849d1d436a4739867e70de","observation_id":"0f10747d-6b07-4af0-b75b-552092ec3032","resolution":{"observed_at":"2026-08-07T00:32:53.901414Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.09645","last_updated":"2021-07-20T17:29:13Z","snapshot_observed_at":"2026-07-06T11:30:56.150751Z","submitted_at":"2021-07-20T17:29:13Z","title":"Mastering Visual Continuous Control: Improved Data-Augmented Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.09645","snapshot_observed_at":"2026-08-07T00:32:53.985431Z","title":"Mastering visual continuous control: Improved data-augmented reinforcement learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.13672","last_updated":"2025-06-16T16:30:00Z","snapshot_observed_at":"2026-08-09T12:19:47.488554Z","submitted_at":"2025-06-16T16:30:00Z","title":"The Courage to Stop: Overcoming Sunk Cost Fallacy in Deep Reinforcement Learning","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-07T00:32:53.985431Z"},"links":{"cited_paper":"/paper/2107.09645","citing_paper":"/paper/2506.13672"},"observation_digest":"sha256:51f850adab26c8a223d4b2a4717d005077e22a0f772711bc2c6b243b9b814d23","observation_id":"c727a42e-9e6c-4af3-97cf-7fda9d49554c","resolution":{"observed_at":"2026-08-07T00:32:53.985431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12579","last_updated":"2023-07-03T04:36:44Z","snapshot_observed_at":"2026-07-06T14:45:52.127467Z","submitted_at":"2023-01-29T23:17:26Z","title":"Sample Efficient Deep Reinforcement Learning via Local Planning","version":2},"cited_work":{"arxiv_id":"2301.12579","doi":null,"metadata_source":"pith","pith_arxiv_id":"2301.12579","snapshot_observed_at":"2026-08-07T00:32:55.022274Z","title":"Sample Efficient Deep Reinforcement Learning via Local Planning","venue":"cs.LG","work_id":"14528dbb-37df-453f-93de-68bb5539129d","year":2023},"citing_paper":{"arxiv_id":"2506.13672","last_updated":"2025-06-16T16:30:00Z","snapshot_observed_at":"2026-08-09T12:19:47.488554Z","submitted_at":"2025-06-16T16:30:00Z","title":"The Courage to Stop: Overcoming Sunk Cost Fallacy in Deep Reinforcement Learning","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-07T00:32:54.102945Z"},"links":{"cited_paper":"/paper/2301.12579","citing_paper":"/paper/2506.13672"},"observation_digest":"sha256:2b18d39412439084994bb87470f8edf685867788a40ad239c74bcfe93fd376b8","observation_id":"a72e8898-159d-41b9-a619-b35c1687e2dc","resolution":{"observed_at":"2026-08-07T00:32:55.136783Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.11550","last_updated":"2023-02-22T18:47:51Z","snapshot_observed_at":"2026-08-05T16:16:51.134330Z","submitted_at":"2023-02-22T18:47:51Z","title":"Scaling Robot Learning with Semantically Imagined Experience","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.11550","snapshot_observed_at":"2026-08-07T00:32:54.190932Z","title":"Scaling robot learning with semantically imagined experience","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13672","last_updated":"2025-06-16T16:30:00Z","snapshot_observed_at":"2026-08-09T12:19:47.488554Z","submitted_at":"2025-06-16T16:30:00Z","title":"The Courage to Stop: Overcoming Sunk Cost Fallacy in Deep Reinforcement Learning","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-07T00:32:54.190932Z"},"links":{"cited_paper":"/paper/2302.11550","citing_paper":"/paper/2506.13672"},"observation_digest":"sha256:37434412cbb442ba9ed02ed1991e3845c8e088eba377c9f60dfd84b074196c6a","observation_id":"0475043e-986d-4206-bde3-a48ea046d7fb","resolution":{"observed_at":"2026-08-07T00:32:54.190932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:32:55.831373Z","title":"Taco: Temporal latent action-driven contrastive loss for visual reinforcement learning","venue":null,"work_id":"0af2d92b-7ef3-48ce-8245-d63ea79e62bd","year":2024},"citing_paper":{"arxiv_id":"2506.13672","last_updated":"2025-06-16T16:30:00Z","snapshot_observed_at":"2026-08-09T12:19:47.488554Z","submitted_at":"2025-06-16T16:30:00Z","title":"The Courage to Stop: Overcoming Sunk Cost Fallacy in Deep Reinforcement Learning","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-07T00:32:54.287162Z"},"links":{"citing_paper":"/paper/2506.13672"},"observation_digest":"sha256:6afcee84d1adf19943c7740ea841feb74052c66f6648b0d966d8622128130f25","observation_id":"0b575bae-4391-42df-9f0a-3a9a92463523","resolution":{"observed_at":"2026-08-07T00:32:55.835270Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:32:54.400821Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.13672","last_updated":"2025-06-16T16:30:00Z","snapshot_observed_at":"2026-08-09T12:19:47.488554Z","submitted_at":"2025-06-16T16:30:00Z","title":"The Courage to Stop: Overcoming Sunk Cost Fallacy in Deep Reinforcement Learning","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-07T00:32:54.400821Z"},"links":{"citing_paper":"/paper/2506.13672"},"observation_digest":"sha256:6bb742742bc6ddc6d8bc820d0db874ee6892a0207c5b8e32ce9c3c8d0fdb552d","observation_id":"ea620ca8-f979-4a01-ac43-e0762f4be893","resolution":{"observed_at":"2026-08-07T00:32:54.400821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.13672","last_updated":"2025-06-16T16:30:00Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T12:19:47.488554Z","submitted_at":"2025-06-16T16:30:00Z","title":"The Courage to Stop: Overcoming Sunk Cost Fallacy in Deep Reinforcement Learning"},"reference_resolution":{"displayed":67,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":36,"verified_exact":9,"verified_fuzzy":21},"total_outbound_references":67},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 67 of 67 outbound references and 0 inbound Pith citation observations for arXiv:2506.13672."}