{"as_of":"2026-08-10T04:14:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7d49b80c4c5c85311459f06a90e9c8b9edefa2b59dd80ba6294da32888b0269b","coverage":[{"denominator":43,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T18:16:20.393795Z","state":"measured"},{"denominator":43,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":43,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.08793/citation-record","integrity":"/paper/2507.08793/integrity","json":"/paper/2507.08793/citation-record.json","paper":"/paper/2507.08793"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:16:20.265612Z","title":null,"venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2507.08793","last_updated":"2025-08-27T12:33:06Z","snapshot_observed_at":"2026-08-09T19:47:20.108617Z","submitted_at":"2025-07-11T17:54:54Z","title":"Optimistic Exploration for Risk-Averse Constrained Reinforcement Learning","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T18:16:20.265612Z"},"links":{"citing_paper":"/paper/2507.08793"},"observation_digest":"sha256:79be79d23a74252825fd085bd82ef3065104a442d6fb4ca44eee6208deffc19a","observation_id":"85169c1f-2474-4d32-83e2-6cd9c6e5e37d","resolution":{"observed_at":"2026-08-06T18:16:20.265612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:16:21.157631Z","title":"Achiam, D","venue":null,"work_id":"5eddd56e-2c73-41d7-8775-e84c491402fc","year":2017},"citing_paper":{"arxiv_id":"2507.08793","last_updated":"2025-08-27T12:33:06Z","snapshot_observed_at":"2026-08-09T19:47:20.108617Z","submitted_at":"2025-07-11T17:54:54Z","title":"Optimistic Exploration for Risk-Averse Constrained Reinforcement Learning","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T18:16:20.269571Z"},"links":{"citing_paper":"/paper/2507.08793"},"observation_digest":"sha256:37e008ca3b6649a560856d8f8177a4617728aa5cd5694f1db359900d0e15d4c6","observation_id":"c78ee23a-94d1-49ca-bc49-83ae64b7d3c4","resolution":{"observed_at":"2026-08-06T18:16:21.161608Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:16:21.146671Z","title":null,"venue":null,"work_id":"f2eb6d34-87ac-42d3-b342-63d831b3aff9","year":1999},"citing_paper":{"arxiv_id":"2507.08793","last_updated":"2025-08-27T12:33:06Z","snapshot_observed_at":"2026-08-09T19:47:20.108617Z","submitted_at":"2025-07-11T17:54:54Z","title":"Optimistic Exploration for Risk-Averse Constrained Reinforcement Learning","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T18:16:20.273446Z"},"links":{"citing_paper":"/paper/2507.08793"},"observation_digest":"sha256:120c1abd702308eb01e3de5409a721db4e91772b59a06d7bb235984db8886db0","observation_id":"2f5bf2da-7395-4026-812e-6925e8ab4106","resolution":{"observed_at":"2026-08-06T18:16:21.150769Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"books/9781315","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:16:20.887102Z","title":"URL https://www.taylorfrancis.com/ books/9781315140223","venue":null,"work_id":"1c4568d3-b235-46f6-b3ce-d5fdcfdeb8e7","year":null},"citing_paper":{"arxiv_id":"2507.08793","last_updated":"2025-08-27T12:33:06Z","snapshot_observed_at":"2026-08-09T19:47:20.108617Z","submitted_at":"2025-07-11T17:54:54Z","title":"Optimistic Exploration for Risk-Averse Constrained Reinforcement Learning","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T18:16:20.276699Z"},"links":{"citing_paper":"/paper/2507.08793"},"observation_digest":"sha256:68ba1ee73f23dfcb104fbdd472dbd1daceb868818e686ffba19c45feb484bb8e","observation_id":"99b136a4-d6b1-492d-a280-04ebd9a2de28","resolution":{"observed_at":"2026-08-06T18:16:20.894237Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:16:21.136706Z","title":null,"venue":null,"work_id":"b2a3818c-00a5-4318-8526-c458a51f06db","year":2023},"citing_paper":{"arxiv_id":"2507.08793","last_updated":"2025-08-27T12:33:06Z","snapshot_observed_at":"2026-08-09T19:47:20.108617Z","submitted_at":"2025-07-11T17:54:54Z","title":"Optimistic Exploration for Risk-Averse Constrained Reinforcement Learning","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T18:16:20.280342Z"},"links":{"citing_paper":"/paper/2507.08793"},"observation_digest":"sha256:e0ca522b9238e5558e5d908ba8e5dd6b798e985b048a66beb545a9cc7849a71c","observation_id":"10da4b1f-745e-4bd6-8a2a-ff00fb672a0e","resolution":{"observed_at":"2026-08-06T18:16:21.140079Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.14497","last_updated":"2021-04-26T17:38:23Z","snapshot_observed_at":"2026-07-06T10:09:06.864468Z","submitted_at":"2020-10-27T17:54:25Z","title":"Conservative Safety Critics for Exploration","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.14497","snapshot_observed_at":"2026-08-06T18:16:20.283541Z","title":"Bharadhwaj, A","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.08793","last_updated":"2025-08-27T12:33:06Z","snapshot_observed_at":"2026-08-09T19:47:20.108617Z","submitted_at":"2025-07-11T17:54:54Z","title":"Optimistic Exploration for Risk-Averse Constrained Reinforcement Learning","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T18:16:20.283541Z"},"links":{"cited_paper":"/paper/2010.14497","citing_paper":"/paper/2507.08793"},"observation_digest":"sha256:9fb81ba5c0f3f3c227bfe00066d2177c0adc301fcba5bb5aae7126bcbf536189","observation_id":"334bd6ef-b2c9-4c2d-ba11-59d06e5ab319","resolution":{"observed_at":"2026-08-06T18:16:20.283541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:16:21.126707Z","title":null,"venue":null,"work_id":"63379256-14a7-4199-b605-5770b3d46c8a","year":2020},"citing_paper":{"arxiv_id":"2507.08793","last_updated":"2025-08-27T12:33:06Z","snapshot_observed_at":"2026-08-09T19:47:20.108617Z","submitted_at":"2025-07-11T17:54:54Z","title":"Optimistic Exploration for Risk-Averse Constrained Reinforcement Learning","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T18:16:20.286739Z"},"links":{"citing_paper":"/paper/2507.08793"},"observation_digest":"sha256:4e58ac10e656df33f8bc464b599aeaeb1f92247cc822a434fbcc0a72f92bc238","observation_id":"ba9042e4-53ec-492e-8a96-3a0cc5d3d1c0","resolution":{"observed_at":"2026-08-06T18:16:21.130433Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/978-3-030-47229-0_2","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:03:56.115653Z","title":"URL http://link.springer.com/ 10.1007/978-3-030-47229-0_2","venue":"SpringerBriefs in applied sciences and technology","work_id":"0745d967-1407-4746-8a56-16f77bc6d457","year":null},"citing_paper":{"arxiv_id":"2507.08793","last_updated":"2025-08-27T12:33:06Z","snapshot_observed_at":"2026-08-09T19:47:20.108617Z","submitted_at":"2025-07-11T17:54:54Z","title":"Optimistic Exploration for Risk-Averse Constrained Reinforcement Learning","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T18:16:20.289970Z"},"links":{"citing_paper":"/paper/2507.08793"},"observation_digest":"sha256:dd8817863ce84ea7303a93b0264ba974ba073d6ec6a16669d352f399e3c0a8f1","observation_id":"7d8f4cf1-db2b-43b1-88be-fe6ddf946b78","resolution":{"observed_at":"2026-08-06T18:16:20.475703Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:16:20.293032Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08793","last_updated":"2025-08-27T12:33:06Z","snapshot_observed_at":"2026-08-09T19:47:20.108617Z","submitted_at":"2025-07-11T17:54:54Z","title":"Optimistic Exploration for Risk-Averse Constrained Reinforcement Learning","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T18:16:20.293032Z"},"links":{"citing_paper":"/paper/2507.08793"},"observation_digest":"sha256:83c7dbcb80a6579b2569445b664ea90f984cd37bbe308ee31f11a8f0921ceac0","observation_id":"3e23013e-a1d1-4cd9-a6ea-3d81be2ab9db","resolution":{"observed_at":"2026-08-06T18:16:20.293032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:16:21.115920Z","title":"Ciosek, Q","venue":null,"work_id":"6c5a9efd-a6d3-40e9-9124-304796b56bab","year":null},"citing_paper":{"arxiv_id":"2507.08793","last_updated":"2025-08-27T12:33:06Z","snapshot_observed_at":"2026-08-09T19:47:20.108617Z","submitted_at":"2025-07-11T17:54:54Z","title":"Optimistic Exploration for Risk-Averse Constrained Reinforcement Learning","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T18:16:20.295752Z"},"links":{"citing_paper":"/paper/2507.08793"},"observation_digest":"sha256:3582614a0a8501bc71a86780986da2c96bb3de2d10cb99238041817fd6835549","observation_id":"ba5f3ea4-0f02-4be8-88ee-5a62995611e9","resolution":{"observed_at":"2026-08-06T18:16:21.120210Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:16:20.308109Z","title":"Dulac-Arnold, N","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.08793","last_updated":"2025-08-27T12:33:06Z","snapshot_observed_at":"2026-08-09T19:47:20.108617Z","submitted_at":"2025-07-11T17:54:54Z","title":"Optimistic Exploration for Risk-Averse Constrained Reinforcement Learning","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T18:16:20.308109Z"},"links":{"citing_paper":"/paper/2507.08793"},"observation_digest":"sha256:cc2a08782fd14a0e7bf176ae4ea66763ff120d925428aa19dec88bee219865db","observation_id":"b050d13b-5ec4-46a6-bf6e-12b04d4ac8d1","resolution":{"observed_at":"2026-08-06T18:16:20.308109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:16:21.095308Z","title":"Dabney, G","venue":null,"work_id":"d7f97587-37e8-4727-9373-7d70e0504329","year":2018},"citing_paper":{"arxiv_id":"2507.08793","last_updated":"2025-08-27T12:33:06Z","snapshot_observed_at":"2026-08-09T19:47:20.108617Z","submitted_at":"2025-07-11T17:54:54Z","title":"Optimistic Exploration for Risk-Averse Constrained Reinforcement Learning","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T18:16:20.302262Z"},"links":{"citing_paper":"/paper/2507.08793"},"observation_digest":"sha256:3542ffe2654b6a4f6eb7bd114e4fbf9e6cdb3f04402f16d52af100a59e78d092","observation_id":"36653d98-fc44-4a9f-a91c-8973f5741982","resolution":{"observed_at":"2026-08-06T18:16:21.099351Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:16:20.305386Z","title":"Dabney, M","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.08793","last_updated":"2025-08-27T12:33:06Z","snapshot_observed_at":"2026-08-09T19:47:20.108617Z","submitted_at":"2025-07-11T17:54:54Z","title":"Optimistic Exploration for Risk-Averse Constrained Reinforcement Learning","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T18:16:20.305386Z"},"links":{"citing_paper":"/paper/2507.08793"},"observation_digest":"sha256:ec3b730765eecbf31737e018a309359e82cbc6c0de80e646ce3aceb4be790e8a","observation_id":"4ec4054a-f3c8-489c-8506-0d43678497a7","resolution":{"observed_at":"2026-08-06T18:16:20.305386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:16:21.059469Z","title":"Greenberg, Y","venue":null,"work_id":"ea0b646f-46ab-4b5f-80d5-bdf38f1a188a","year":2022},"citing_paper":{"arxiv_id":"2507.08793","last_updated":"2025-08-27T12:33:06Z","snapshot_observed_at":"2026-08-09T19:47:20.108617Z","submitted_at":"2025-07-11T17:54:54Z","title":"Optimistic Exploration for Risk-Averse Constrained Reinforcement Learning","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T18:16:20.316924Z"},"links":{"citing_paper":"/paper/2507.08793"},"observation_digest":"sha256:728d8790512df077bf07742d37ce340913a2f4e3e38e17ba01090db9ac493ce3","observation_id":"77a55356-524b-47a7-801b-9d4772fe226e","resolution":{"observed_at":"2026-08-06T18:16:21.063895Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:16:21.084048Z","title":"Fujimoto, H","venue":null,"work_id":"17f53127-a725-4cc2-87da-3bd7d57bdf20","year":2018},"citing_paper":{"arxiv_id":"2507.08793","last_updated":"2025-08-27T12:33:06Z","snapshot_observed_at":"2026-08-09T19:47:20.108617Z","submitted_at":"2025-07-11T17:54:54Z","title":"Optimistic Exploration for Risk-Averse Constrained Reinforcement Learning","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T18:16:20.311329Z"},"links":{"citing_paper":"/paper/2507.08793"},"observation_digest":"sha256:ff037e04920df047cca293b024468e25d44d314edfb97b51fa7ce18d6d598537","observation_id":"745ac99c-5d23-439a-be08-3cf46bbcad79","resolution":{"observed_at":"2026-08-06T18:16:21.088505Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:16:21.072045Z","title":"García and F","venue":null,"work_id":"5cdd01fc-067d-43e6-b6b2-4f2d9bbe7313","year":2015},"citing_paper":{"arxiv_id":"2507.08793","last_updated":"2025-08-27T12:33:06Z","snapshot_observed_at":"2026-08-09T19:47:20.108617Z","submitted_at":"2025-07-11T17:54:54Z","title":"Optimistic Exploration for Risk-Averse Constrained Reinforcement Learning","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T18:16:20.314227Z"},"links":{"citing_paper":"/paper/2507.08793"},"observation_digest":"sha256:6f45eb6a5f1d42c9269701f4581e7dddca42f61d0f3f405ccb6c8ac888992331","observation_id":"01fe2aeb-8e51-4a3b-b952-f56908b13312","resolution":{"observed_at":"2026-08-06T18:16:21.076617Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:16:20.326107Z","title":null,"venue":null,"work_id":null,"year":1964},"citing_paper":{"arxiv_id":"2507.08793","last_updated":"2025-08-27T12:33:06Z","snapshot_observed_at":"2026-08-09T19:47:20.108617Z","submitted_at":"2025-07-11T17:54:54Z","title":"Optimistic Exploration for Risk-Averse Constrained Reinforcement Learning","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T18:16:20.326107Z"},"links":{"citing_paper":"/paper/2507.08793"},"observation_digest":"sha256:b7042a6674ce8bf745435c95dfbd0d6e580ec7849a458122cc0a0e8d15e03e44","observation_id":"9918112f-688d-42f7-b36c-f6bf42fe7645","resolution":{"observed_at":"2026-08-06T18:16:20.326107Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.10330","last_updated":"2024-05-24T22:33:04Z","snapshot_observed_at":"2026-08-09T19:46:45.414506Z","submitted_at":"2022-05-20T17:42:38Z","title":"A Review of Safe Reinforcement Learning: Methods, Theory and Applications","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.10330","snapshot_observed_at":"2026-08-06T18:16:20.319931Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08793","last_updated":"2025-08-27T12:33:06Z","snapshot_observed_at":"2026-08-09T19:47:20.108617Z","submitted_at":"2025-07-11T17:54:54Z","title":"Optimistic Exploration for Risk-Averse Constrained Reinforcement Learning","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T18:16:20.319931Z"},"links":{"cited_paper":"/paper/2205.10330","citing_paper":"/paper/2507.08793"},"observation_digest":"sha256:baffc90d9fcf685b02ce53964920c317815f95d031de8298ac52b21ed3c1870f","observation_id":"ad4d0621-b059-413d-ba5f-73b60461ee9c","resolution":{"observed_at":"2026-08-06T18:16:20.319931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:16:21.048858Z","title":"Haarnoja, A","venue":null,"work_id":"e15a3757-ce23-42a8-a18f-341b51f2d468","year":2018},"citing_paper":{"arxiv_id":"2507.08793","last_updated":"2025-08-27T12:33:06Z","snapshot_observed_at":"2026-08-09T19:47:20.108617Z","submitted_at":"2025-07-11T17:54:54Z","title":"Optimistic Exploration for Risk-Averse Constrained Reinforcement Learning","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T18:16:20.323308Z"},"links":{"citing_paper":"/paper/2507.08793"},"observation_digest":"sha256:f95dbcce3cf43f6027ff689bf118e7a44ee571923a3ee271320569aaf389209d","observation_id":"9966e55c-d5c0-4251-9c88-586fc86cd7cb","resolution":{"observed_at":"2026-08-06T18:16:21.052577Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:16:21.015279Z","title":null,"venue":null,"work_id":"8819d02c-834a-4e54-a733-1e73e789ae1a","year":null},"citing_paper":{"arxiv_id":"2507.08793","last_updated":"2025-08-27T12:33:06Z","snapshot_observed_at":"2026-08-09T19:47:20.108617Z","submitted_at":"2025-07-11T17:54:54Z","title":"Optimistic Exploration for Risk-Averse Constrained Reinforcement Learning","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T18:16:20.337702Z"},"links":{"citing_paper":"/paper/2507.08793"},"observation_digest":"sha256:428b9a7a129bf65a3e5d1a8332a6fb8f1cf091cfcc1cb0c6a4ea621b48aa9f02","observation_id":"b68dd2f5-9d4c-477c-ae23-a25e9150fd55","resolution":{"observed_at":"2026-08-06T18:16:21.019625Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:16:21.037893Z","title":null,"venue":null,"work_id":"6dfb3041-3813-4b81-bba4-55ed468b09a0","year":2023},"citing_paper":{"arxiv_id":"2507.08793","last_updated":"2025-08-27T12:33:06Z","snapshot_observed_at":"2026-08-09T19:47:20.108617Z","submitted_at":"2025-07-11T17:54:54Z","title":"Optimistic Exploration for Risk-Averse Constrained Reinforcement Learning","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T18:16:20.328938Z"},"links":{"citing_paper":"/paper/2507.08793"},"observation_digest":"sha256:ae382f5bfd0b9e4cc6617b4520bf23c470d00c7cf45830ef2f29202f8487631a","observation_id":"0eeb7a3e-fd78-417b-92aa-728371c21407","resolution":{"observed_at":"2026-08-06T18:16:21.042172Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:16:21.027053Z","title":"Keramati, C","venue":null,"work_id":"1dc97563-7c75-488f-af0f-ae512f6d1ce4","year":null},"citing_paper":{"arxiv_id":"2507.08793","last_updated":"2025-08-27T12:33:06Z","snapshot_observed_at":"2026-08-09T19:47:20.108617Z","submitted_at":"2025-07-11T17:54:54Z","title":"Optimistic Exploration for Risk-Averse Constrained Reinforcement Learning","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T18:16:20.331991Z"},"links":{"citing_paper":"/paper/2507.08793"},"observation_digest":"sha256:880c69d58363ffb218ea9e3b9c3b937623d760484820fc81c9bb52083c1d687b","observation_id":"fc086859-bab3-4ba1-b69b-9e59d962a00a","resolution":{"observed_at":"2026-08-06T18:16:21.031236Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:16:20.971911Z","title":null,"venue":null,"work_id":"32058f37-632f-4d7f-86a7-e68c00042587","year":2022},"citing_paper":{"arxiv_id":"2507.08793","last_updated":"2025-08-27T12:33:06Z","snapshot_observed_at":"2026-08-09T19:47:20.108617Z","submitted_at":"2025-07-11T17:54:54Z","title":"Optimistic Exploration for Risk-Averse Constrained Reinforcement Learning","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T18:16:20.353103Z"},"links":{"citing_paper":"/paper/2507.08793"},"observation_digest":"sha256:41de395038bb911b33226c2b01971df8570853bcc2931dc8d47630991ebcc6d0","observation_id":"8bd58267-2152-4bb0-9453-8ab9cf38b511","resolution":{"observed_at":"2026-08-06T18:16:20.976093Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.14547","last_updated":"2025-06-29T01:33:14Z","snapshot_observed_at":"2026-07-06T09:16:26.306280Z","submitted_at":"2020-04-30T02:23:15Z","title":"DSAC: Distributional Soft Actor-Critic for Risk-Sensitive Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.14547","snapshot_observed_at":"2026-08-06T18:16:20.355708Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.08793","last_updated":"2025-08-27T12:33:06Z","snapshot_observed_at":"2026-08-09T19:47:20.108617Z","submitted_at":"2025-07-11T17:54:54Z","title":"Optimistic Exploration for Risk-Averse Constrained Reinforcement Learning","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T18:16:20.355708Z"},"links":{"cited_paper":"/paper/2004.14547","citing_paper":"/paper/2507.08793"},"observation_digest":"sha256:f5d9713e98075c41b525f6915853e15f5040504724e4e7ca0cc7373162492ff1","observation_id":"bca846fa-3090-4fc3-ba8d-7e77f042793d","resolution":{"observed_at":"2026-08-06T18:16:20.355708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.03765","last_updated":"2022-04-06T12:03:06Z","snapshot_observed_at":"2026-08-09T15:48:18.869153Z","submitted_at":"2021-02-07T10:28:09Z","title":"Tactical Optimism and Pessimism for Deep Reinforcement Learning","version":5},"cited_work":{"arxiv_id":"2102.03765","doi":null,"metadata_source":"pith","pith_arxiv_id":"2102.03765","snapshot_observed_at":"2026-08-06T18:16:20.713559Z","title":"Tactical Optimism and Pessimism for Deep Reinforcement Learning","venue":"cs.LG","work_id":"e6350f0c-ac59-4d62-b516-0eb346c09ce6","year":2021},"citing_paper":{"arxiv_id":"2507.08793","last_updated":"2025-08-27T12:33:06Z","snapshot_observed_at":"2026-08-09T19:47:20.108617Z","submitted_at":"2025-07-11T17:54:54Z","title":"Optimistic Exploration for Risk-Averse Constrained Reinforcement Learning","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T18:16:20.358680Z"},"links":{"cited_paper":"/paper/2102.03765","citing_paper":"/paper/2507.08793"},"observation_digest":"sha256:e26e5596c5e1c69c7be8f997abd007dad99bccf8b5bccbeb537c83ff2796bff9","observation_id":"d257a5e6-d71b-4f49-a9c7-5a43b13e2e6c","resolution":{"observed_at":"2026-08-06T18:16:20.718766Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:16:20.994133Z","title":null,"venue":null,"work_id":"fc29b89e-9f96-4212-af25-642701f16430","year":null},"citing_paper":{"arxiv_id":"2507.08793","last_updated":"2025-08-27T12:33:06Z","snapshot_observed_at":"2026-08-09T19:47:20.108617Z","submitted_at":"2025-07-11T17:54:54Z","title":"Optimistic Exploration for Risk-Averse Constrained Reinforcement Learning","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T18:16:20.343777Z"},"links":{"citing_paper":"/paper/2507.08793"},"observation_digest":"sha256:211c3b1c693b06feeaa88baf11ec9dadbd59b11397f39886806ca63100510460","observation_id":"74203ad6-def4-49b4-85ca-687e5551bbbd","resolution":{"observed_at":"2026-08-06T18:16:20.998791Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"technical-paper/2161159","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:16:20.697189Z","title":null,"venue":null,"work_id":"567d9117-baab-4838-888a-d04b2289f461","year":2000},"citing_paper":{"arxiv_id":"2507.08793","last_updated":"2025-08-27T12:33:06Z","snapshot_observed_at":"2026-08-09T19:47:20.108617Z","submitted_at":"2025-07-11T17:54:54Z","title":"Optimistic Exploration for Risk-Averse Constrained Reinforcement Learning","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T18:16:20.364763Z"},"links":{"citing_paper":"/paper/2507.08793"},"observation_digest":"sha256:526f776e55b5d53c572e865419bfc208be7a24a9f0c83f17eeb664aa7886f2d5","observation_id":"78a4e5e6-dcbf-4294-9b69-d7654619a108","resolution":{"observed_at":"2026-08-06T18:16:20.703420Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1609/aaai.v38i12.29303","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:16:20.438560Z","title":null,"venue":null,"work_id":"a11799a8-4ba9-445f-b5d0-ede843264a9d","year":2024},"citing_paper":{"arxiv_id":"2507.08793","last_updated":"2025-08-27T12:33:06Z","snapshot_observed_at":"2026-08-09T19:47:20.108617Z","submitted_at":"2025-07-11T17:54:54Z","title":"Optimistic Exploration for Risk-Averse Constrained Reinforcement Learning","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T18:16:20.349913Z"},"links":{"citing_paper":"/paper/2507.08793"},"observation_digest":"sha256:d9caccd13e87383d84b771b24c4307e1593f2cf83de13b95a6ac11af6185a4fc","observation_id":"b4c21e26-a11c-475a-b109-3033e8a6e107","resolution":{"observed_at":"2026-08-06T18:16:20.441495Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:16:20.936702Z","title":null,"venue":null,"work_id":"403680d6-d9f4-44ab-88e8-e78bcd5a94e5","year":2021},"citing_paper":{"arxiv_id":"2507.08793","last_updated":"2025-08-27T12:33:06Z","snapshot_observed_at":"2026-08-09T19:47:20.108617Z","submitted_at":"2025-07-11T17:54:54Z","title":"Optimistic Exploration for Risk-Averse Constrained Reinforcement Learning","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T18:16:20.370301Z"},"links":{"citing_paper":"/paper/2507.08793"},"observation_digest":"sha256:70dd2f27a84424c062e991b289a212f20c3eb2cd6a7dee81d06911ad5c8756d4","observation_id":"adf571f2-2d9b-4da3-a3ff-d4f315a56704","resolution":{"observed_at":"2026-08-06T18:16:20.939983Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:16:20.372943Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.08793","last_updated":"2025-08-27T12:33:06Z","snapshot_observed_at":"2026-08-09T19:47:20.108617Z","submitted_at":"2025-07-11T17:54:54Z","title":"Optimistic Exploration for Risk-Averse Constrained Reinforcement Learning","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T18:16:20.372943Z"},"links":{"citing_paper":"/paper/2507.08793"},"observation_digest":"sha256:341a3355044b61b553b1c00f4ae690f2a7bc0ae5434990d65d750f9eda7144f8","observation_id":"e1ad41e0-ce4d-4b1e-b54c-5fac5d801768","resolution":{"observed_at":"2026-08-06T18:16:20.372943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"0322.33609","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:16:20.557142Z","title":null,"venue":null,"work_id":"97169868-e53e-4e47-924b-2d104467fb29","year":2019},"citing_paper":{"arxiv_id":"2507.08793","last_updated":"2025-08-27T12:33:06Z","snapshot_observed_at":"2026-08-09T19:47:20.108617Z","submitted_at":"2025-07-11T17:54:54Z","title":"Optimistic Exploration for Risk-Averse Constrained Reinforcement Learning","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T18:16:20.376120Z"},"links":{"citing_paper":"/paper/2507.08793"},"observation_digest":"sha256:9241a80bc9f9133aa5fef8b609a1496003b4f2f997751d2042315adb868664f9","observation_id":"97ef87c4-b94b-486f-ad08-c56f2dcb999d","resolution":{"observed_at":"2026-08-06T18:16:20.561857Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:16:20.960392Z","title":null,"venue":null,"work_id":"8bf60c98-88d4-4eb4-bc52-a7ddc3920f05","year":2019},"citing_paper":{"arxiv_id":"2507.08793","last_updated":"2025-08-27T12:33:06Z","snapshot_observed_at":"2026-08-09T19:47:20.108617Z","submitted_at":"2025-07-11T17:54:54Z","title":"Optimistic Exploration for Risk-Averse Constrained Reinforcement Learning","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T18:16:20.361963Z"},"links":{"citing_paper":"/paper/2507.08793"},"observation_digest":"sha256:3c7483fdf4e00db12204a9efcac20da80f8660fc33c8d1c2c1ad25d8232cd9f4","observation_id":"703b8e56-3691-4e62-ad75-8c511594ad38","resolution":{"observed_at":"2026-08-06T18:16:20.964679Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:16:20.926271Z","title":null,"venue":null,"work_id":"46f6bf0c-f60a-40c7-9301-f53d841553f5","year":2024},"citing_paper":{"arxiv_id":"2507.08793","last_updated":"2025-08-27T12:33:06Z","snapshot_observed_at":"2026-08-09T19:47:20.108617Z","submitted_at":"2025-07-11T17:54:54Z","title":"Optimistic Exploration for Risk-Averse Constrained Reinforcement Learning","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T18:16:20.382439Z"},"links":{"citing_paper":"/paper/2507.08793"},"observation_digest":"sha256:8661ff67a77acfdf71ad4b52df016ffecb18b1c4008ac7400620bc63917d286a","observation_id":"e6964274-f112-403c-b9e0-2a9a18052baf","resolution":{"observed_at":"2026-08-06T18:16:20.930157Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:16:20.947415Z","title":"Tessler, D","venue":null,"work_id":"8e12da9c-4a22-425a-8682-17b491be7fad","year":2019},"citing_paper":{"arxiv_id":"2507.08793","last_updated":"2025-08-27T12:33:06Z","snapshot_observed_at":"2026-08-09T19:47:20.108617Z","submitted_at":"2025-07-11T17:54:54Z","title":"Optimistic Exploration for Risk-Averse Constrained Reinforcement Learning","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T18:16:20.367484Z"},"links":{"citing_paper":"/paper/2507.08793"},"observation_digest":"sha256:ab67c791ef7b1362f84c6248f998f568e72c3b9a1809567d734d9f1f8fa17a40","observation_id":"ec6ea63c-bac9-4904-a80c-032fc1db6deb","resolution":{"observed_at":"2026-08-06T18:16:20.951144Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:16:20.914833Z","title":null,"venue":null,"work_id":"79aac85e-8bc5-4a6e-93a0-695c7c55aa46","year":2024},"citing_paper":{"arxiv_id":"2507.08793","last_updated":"2025-08-27T12:33:06Z","snapshot_observed_at":"2026-08-09T19:47:20.108617Z","submitted_at":"2025-07-11T17:54:54Z","title":"Optimistic Exploration for Risk-Averse Constrained Reinforcement Learning","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T18:16:20.388298Z"},"links":{"citing_paper":"/paper/2507.08793"},"observation_digest":"sha256:aa306b6c48369d0f5d9a379b6bd8a7ad8f8d00265b178d56641879f8ebf44e47","observation_id":"466639f7-ea84-4fd5-94c4-5b60e111bde7","resolution":{"observed_at":"2026-08-06T18:16:20.919047Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:16:20.901908Z","title":"Zhang, L","venue":null,"work_id":"c2f73865-724b-464a-bb85-3165277f66af","year":null},"citing_paper":{"arxiv_id":"2507.08793","last_updated":"2025-08-27T12:33:06Z","snapshot_observed_at":"2026-08-09T19:47:20.108617Z","submitted_at":"2025-07-11T17:54:54Z","title":"Optimistic Exploration for Risk-Averse Constrained Reinforcement Learning","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T18:16:20.391082Z"},"links":{"citing_paper":"/paper/2507.08793"},"observation_digest":"sha256:1d3d2cfe2f0acb190d9d4461ed9d41a73daa659b7a3c4ca6d458e033081abbd9","observation_id":"9e10b2c1-e853-4d7c-9a37-1416399ce2cb","resolution":{"observed_at":"2026-08-06T18:16:20.906535Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03225","last_updated":"2023-10-05T00:47:09Z","snapshot_observed_at":"2026-08-09T09:17:10.910009Z","submitted_at":"2023-10-05T00:47:09Z","title":"Safe Exploration in Reinforcement Learning: A Generalized Formulation and Algorithms","version":1},"cited_work":{"arxiv_id":"2310.03225","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.03225","snapshot_observed_at":"2026-08-06T18:16:20.492797Z","title":"Safe Exploration in Reinforcement Learning: A Generalized Formulation and Algorithms","venue":"cs.LG","work_id":"5c03cd0d-185b-4603-b426-22a0155e43d6","year":2023},"citing_paper":{"arxiv_id":"2507.08793","last_updated":"2025-08-27T12:33:06Z","snapshot_observed_at":"2026-08-09T19:47:20.108617Z","submitted_at":"2025-07-11T17:54:54Z","title":"Optimistic Exploration for Risk-Averse Constrained Reinforcement Learning","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T18:16:20.379226Z"},"links":{"cited_paper":"/paper/2310.03225","citing_paper":"/paper/2507.08793"},"observation_digest":"sha256:b59997739cce5e232a1c8373805b4601e7b598c92f038ab6124b99c01d0d62fa","observation_id":"fa70d111-8315-46e7-86fc-53ef2dc3324f","resolution":{"observed_at":"2026-08-06T18:16:20.497430Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/s10994-022-06187-8","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:03:40.895421Z","title":null,"venue":"Machine Learning","work_id":"8c92fb25-6d10-4a03-88ec-27524416a8b2","year":2023},"citing_paper":{"arxiv_id":"2507.08793","last_updated":"2025-08-27T12:33:06Z","snapshot_observed_at":"2026-08-09T19:47:20.108617Z","submitted_at":"2025-07-11T17:54:54Z","title":"Optimistic Exploration for Risk-Averse Constrained Reinforcement Learning","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T18:16:20.385189Z"},"links":{"citing_paper":"/paper/2507.08793"},"observation_digest":"sha256:5ff5232fe388f7d8f28aa09862dbd9445e5fa5308f8051471ef17dafdb3f38c3","observation_id":"2a5500dd-42b4-4b0a-952e-edb90df12121","resolution":{"observed_at":"2026-08-06T18:16:20.431760Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:16:21.105719Z","title":null,"venue":null,"work_id":"aa8b950b-25ec-4fc5-9343-b7775ce561e3","year":2019},"citing_paper":{"arxiv_id":"2507.08793","last_updated":"2025-08-27T12:33:06Z","snapshot_observed_at":"2026-08-09T19:47:20.108617Z","submitted_at":"2025-07-11T17:54:54Z","title":"Optimistic Exploration for Risk-Averse Constrained Reinforcement Learning","version":2},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-06T18:16:20.298759Z"},"links":{"citing_paper":"/paper/2507.08793"},"observation_digest":"sha256:6e44355e6b32bafddf3e4c788ce82e7a60d4bdb8602fd3cbf942957b5460f562","observation_id":"be203779-3d81-4970-b384-1ee06a6e0440","resolution":{"observed_at":"2026-08-06T18:16:21.109610Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:16:20.334853Z","title":"doi: 10.1609/aaai.v34i04.5870","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.08793","last_updated":"2025-08-27T12:33:06Z","snapshot_observed_at":"2026-08-09T19:47:20.108617Z","submitted_at":"2025-07-11T17:54:54Z","title":"Optimistic Exploration for Risk-Averse Constrained Reinforcement Learning","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-06T18:16:20.334853Z"},"links":{"citing_paper":"/paper/2507.08793"},"observation_digest":"sha256:9a94246a68dfb74e328a3f8bcfd68e7e90e8d1a9c6a5ab9215294fc3d8cca3ee","observation_id":"e978abee-f9f8-4fb1-9531-6719dd66cf2b","resolution":{"observed_at":"2026-08-06T18:16:20.334853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:16:20.393795Z","title":"ISBN 978-1-956792-00-3","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.08793","last_updated":"2025-08-27T12:33:06Z","snapshot_observed_at":"2026-08-09T19:47:20.108617Z","submitted_at":"2025-07-11T17:54:54Z","title":"Optimistic Exploration for Risk-Averse Constrained Reinforcement Learning","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-06T18:16:20.393795Z"},"links":{"citing_paper":"/paper/2507.08793"},"observation_digest":"sha256:7c8122cf03c121f5345bc7c3429c8b7fbf1c3f3b485c9e1f6e5664e59df9c197","observation_id":"ae520bbf-23d7-44d0-adc9-d448710220e9","resolution":{"observed_at":"2026-08-06T18:16:20.393795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:16:21.005249Z","title":null,"venue":null,"work_id":"65672a58-5c4c-43a8-b072-084e03446f16","year":2023},"citing_paper":{"arxiv_id":"2507.08793","last_updated":"2025-08-27T12:33:06Z","snapshot_observed_at":"2026-08-09T19:47:20.108617Z","submitted_at":"2025-07-11T17:54:54Z","title":"Optimistic Exploration for Risk-Averse Constrained Reinforcement Learning","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T18:16:20.340539Z"},"links":{"citing_paper":"/paper/2507.08793"},"observation_digest":"sha256:eea7aab194432b8a6c1977efd9750c65ace50e91d404484ee8e69c7885bb4522","observation_id":"9f84d7af-92f0-49e0-93ce-2b9c63d4c135","resolution":{"observed_at":"2026-08-06T18:16:21.008867Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:16:20.983424Z","title":null,"venue":null,"work_id":"780bb1e7-a4ea-4df4-b431-2285078d8ef0","year":null},"citing_paper":{"arxiv_id":"2507.08793","last_updated":"2025-08-27T12:33:06Z","snapshot_observed_at":"2026-08-09T19:47:20.108617Z","submitted_at":"2025-07-11T17:54:54Z","title":"Optimistic Exploration for Risk-Averse Constrained Reinforcement Learning","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T18:16:20.346831Z"},"links":{"citing_paper":"/paper/2507.08793"},"observation_digest":"sha256:91f1205cff491241ba2dde1636c66a9903ca3ac5b407fc7e5f8f0844b2f5e984","observation_id":"07e3f8b1-c3f4-4b66-bc30-2748635f41c4","resolution":{"observed_at":"2026-08-06T18:16:20.987053Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.08793","last_updated":"2025-08-27T12:33:06Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T19:47:20.108617Z","submitted_at":"2025-07-11T17:54:54Z","title":"Optimistic Exploration for Risk-Averse Constrained Reinforcement Learning"},"reference_resolution":{"displayed":43,"state_counts":{"malformed_identifier":1,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":24,"verified_exact":7,"verified_fuzzy":10},"total_outbound_references":43},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 43 of 43 outbound references and 0 inbound Pith citation observations for arXiv:2507.08793."}