{"as_of":"2026-08-22T19:24:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:78e049f04f42b5697170bf11147410f3916eaa47fe986e42c6a0b143aa7c3605","coverage":[{"denominator":13,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":13,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T11:30:06.718481Z","state":"measured"},{"denominator":13,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":13,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.15429/citation-record","integrity":"/paper/2412.15429/integrity","json":"/paper/2412.15429/citation-record.json","paper":"/paper/2412.15429"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:30:06.932895Z","title":"Additionally, SafetyGymnasium includes five velocity- constrained tasks for the agents, Ant, HalfCheetah, Hopper, Walker2d, and Swimmer","venue":null,"work_id":"93dd38f7-c8e1-488c-94c4-e41e70ef7a42","year":2004},"citing_paper":{"arxiv_id":"2412.15429","last_updated":"2025-04-19T01:50:15Z","snapshot_observed_at":"2026-08-18T09:57:37.837649Z","submitted_at":"2024-12-19T22:29:03Z","title":"Offline Safe Reinforcement Learning Using Trajectory Classification","version":5},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T11:30:06.718481Z"},"links":{"citing_paper":"/paper/2412.15429"},"observation_digest":"sha256:6a023279f968d308adcec424c24e1fe4c311b002ddf491d37ac2b49e00505f47","observation_id":"4d392448-e575-462f-a099-a19e14447871","resolution":{"observed_at":"2026-08-11T11:30:06.938861Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1905.01240","last_updated":"2019-05-03T15:59:25Z","snapshot_observed_at":"2026-08-14T16:37:39.277365Z","submitted_at":"2019-05-03T15:59:25Z","title":"Information asymmetry in KL-regularized RL","version":1},"cited_work":{"arxiv_id":"1905.01240","doi":null,"metadata_source":"pith","pith_arxiv_id":"1905.01240","snapshot_observed_at":"2026-08-11T11:30:06.858945Z","title":"Information asymmetry in KL-regularized RL","venue":"cs.LG","work_id":"caf4da7b-83f0-4d8f-a910-f1be6a23498a","year":2019},"citing_paper":{"arxiv_id":"2412.15429","last_updated":"2025-04-19T01:50:15Z","snapshot_observed_at":"2026-08-18T09:57:37.837649Z","submitted_at":"2024-12-19T22:29:03Z","title":"Offline Safe Reinforcement Learning Using Trajectory Classification","version":5},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T11:30:06.675090Z"},"links":{"cited_paper":"/paper/1905.01240","citing_paper":"/paper/2412.15429"},"observation_digest":"sha256:046501268f2913dc9d5e5f189ccaf38a73f2ea716b8c43a797c646307e012619","observation_id":"18c774c9-cf56-4bd1-9c01-f50a1989c6ae","resolution":{"observed_at":"2026-08-11T11:30:06.866006Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09303","last_updated":"2023-06-16T17:54:06Z","snapshot_observed_at":"2026-08-16T15:23:34.841529Z","submitted_at":"2023-06-15T17:31:26Z","title":"Datasets and Benchmarks for Offline Safe Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09303","snapshot_observed_at":"2026-08-11T11:30:06.691008Z","title":"IEEE transactions on pattern analysis and machine intelligence, 45(3): 3461–3475","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.15429","last_updated":"2025-04-19T01:50:15Z","snapshot_observed_at":"2026-08-18T09:57:37.837649Z","submitted_at":"2024-12-19T22:29:03Z","title":"Offline Safe Reinforcement Learning Using Trajectory Classification","version":5},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T11:30:06.691008Z"},"links":{"cited_paper":"/paper/2306.09303","citing_paper":"/paper/2412.15429"},"observation_digest":"sha256:87daf1dd1b003ddca68479f7140b39bac3d65e9f2e25aeaf5837c89d20374128","observation_id":"68046617-dae9-4b99-92c5-85eef071965c","resolution":{"observed_at":"2026-08-11T11:30:06.691008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01708","last_updated":"2019-10-03T20:15:55Z","snapshot_observed_at":"2026-08-14T05:35:42.838302Z","submitted_at":"2019-10-03T20:15:55Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.01708","snapshot_observed_at":"2026-08-11T11:30:06.696490Z","title":"arXiv preprint arXiv:1910.01708, 7(1):","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2412.15429","last_updated":"2025-04-19T01:50:15Z","snapshot_observed_at":"2026-08-18T09:57:37.837649Z","submitted_at":"2024-12-19T22:29:03Z","title":"Offline Safe Reinforcement Learning Using Trajectory Classification","version":5},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T11:30:06.696490Z"},"links":{"cited_paper":"/paper/1910.01708","citing_paper":"/paper/2412.15429"},"observation_digest":"sha256:b2b16cbf6924e01064cd2089462808a5b3b6ccaf611f8718ab0ee2e3de939d71","observation_id":"4a019047-0e98-42fb-8f3e-472e92eea9e5","resolution":{"observed_at":"2026-08-11T11:30:06.696490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10700","last_updated":"2024-01-19T14:05:09Z","snapshot_observed_at":"2026-08-19T18:15:33.231718Z","submitted_at":"2024-01-19T14:05:09Z","title":"Safe Offline Reinforcement Learning with Feasibility-Guided Diffusion Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10700","snapshot_observed_at":"2026-08-11T11:30:06.707943Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.15429","last_updated":"2025-04-19T01:50:15Z","snapshot_observed_at":"2026-08-18T09:57:37.837649Z","submitted_at":"2024-12-19T22:29:03Z","title":"Offline Safe Reinforcement Learning Using Trajectory Classification","version":5},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T11:30:06.707943Z"},"links":{"cited_paper":"/paper/2401.10700","citing_paper":"/paper/2412.15429"},"observation_digest":"sha256:6398688647278857eaea3b454f1ebe5acd0c4c53c12c4eb09da815a001e63a4f","observation_id":"a1dbd71a-4b92-46be-99c3-d0db40b902b8","resolution":{"observed_at":"2026-08-11T11:30:06.707943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:30:06.950864Z","title":"In Aaai, vol- ume 8, 1433–1438","venue":null,"work_id":"78beaaae-9b31-40d8-ae2c-38c71ed03832","year":2019},"citing_paper":{"arxiv_id":"2412.15429","last_updated":"2025-04-19T01:50:15Z","snapshot_observed_at":"2026-08-18T09:57:37.837649Z","submitted_at":"2024-12-19T22:29:03Z","title":"Offline Safe Reinforcement Learning Using Trajectory Classification","version":5},"reference_index":2008,"source":"pdf_text","source_observed_at":"2026-08-11T11:30:06.713348Z"},"links":{"citing_paper":"/paper/2412.15429"},"observation_digest":"sha256:cc35cce2462f5c503c13fc79ea5d8912343e3d67e5555c89a639e9e684923921","observation_id":"2fe4b687-9f5c-4d0f-a8b4-67613f411bd7","resolution":{"observed_at":"2026-08-11T11:30:06.956003Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1805.11074","last_updated":"2018-12-26T11:09:40Z","snapshot_observed_at":"2026-08-14T19:10:15.765536Z","submitted_at":"2018-05-28T17:31:11Z","title":"Reward Constrained Policy Optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1805.11074","snapshot_observed_at":"2026-08-11T11:30:06.701825Z","title":"arXiv preprint arXiv:1805.11074","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.15429","last_updated":"2025-04-19T01:50:15Z","snapshot_observed_at":"2026-08-18T09:57:37.837649Z","submitted_at":"2024-12-19T22:29:03Z","title":"Offline Safe Reinforcement Learning Using Trajectory Classification","version":5},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-11T11:30:06.701825Z"},"links":{"cited_paper":"/paper/1805.11074","citing_paper":"/paper/2412.15429"},"observation_digest":"sha256:24428e3c344615a814ba39e6941f65debea7514c379344f9dd8418f9b3a9b122","observation_id":"ca64a2f1-7689-4d97-94bb-72e9c128350c","resolution":{"observed_at":"2026-08-11T11:30:06.701825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:30:06.967660Z","title":"In ICML, 2052–2062","venue":null,"work_id":"013d81b2-0607-4bd4-90db-f36561c26a57","year":null},"citing_paper":{"arxiv_id":"2412.15429","last_updated":"2025-04-19T01:50:15Z","snapshot_observed_at":"2026-08-18T09:57:37.837649Z","submitted_at":"2024-12-19T22:29:03Z","title":"Offline Safe Reinforcement Learning Using Trajectory Classification","version":5},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-11T11:30:06.670083Z"},"links":{"citing_paper":"/paper/2412.15429"},"observation_digest":"sha256:c581715c6458f7ffa5d9b80b3d28495d3ead7cb618c6268b8bd1c937833bce93","observation_id":"b42f9f0c-697c-4533-95c8-63d9743e628e","resolution":{"observed_at":"2026-08-11T11:30:06.974156Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-08-16T08:32:46.407746Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-11T11:30:06.664950Z","title":"arXiv preprint arXiv:2004.07219","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2412.15429","last_updated":"2025-04-19T01:50:15Z","snapshot_observed_at":"2026-08-18T09:57:37.837649Z","submitted_at":"2024-12-19T22:29:03Z","title":"Offline Safe Reinforcement Learning Using Trajectory Classification","version":5},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-11T11:30:06.664950Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2412.15429"},"observation_digest":"sha256:ca63f5814f0eed858001ef804aeebd69bc5ec299fd0a46b047711b75adfebc23","observation_id":"0a912bba-8465-4c31-ae85-d0b710dc8def","resolution":{"observed_at":"2026-08-11T11:30:06.664950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.10895","last_updated":"2021-01-26T16:03:32Z","snapshot_observed_at":"2026-08-20T06:45:05.354499Z","submitted_at":"2021-01-26T16:03:32Z","title":"A Primal-Dual Approach to Constrained Markov Decision Processes","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.10895","snapshot_observed_at":"2026-08-11T11:30:06.654064Z","title":"arXiv preprint arXiv:2101.10895","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.15429","last_updated":"2025-04-19T01:50:15Z","snapshot_observed_at":"2026-08-18T09:57:37.837649Z","submitted_at":"2024-12-19T22:29:03Z","title":"Offline Safe Reinforcement Learning Using Trajectory Classification","version":5},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-11T11:30:06.654064Z"},"links":{"cited_paper":"/paper/2101.10895","citing_paper":"/paper/2412.15429"},"observation_digest":"sha256:722ba3b1c27efb86d46af885b21f4c2ebe32a34465ae79d60308833fc33a1760","observation_id":"4e11c989-1b4f-494d-b00d-2a18c3091576","resolution":{"observed_at":"2026-08-11T11:30:06.654064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.10330","last_updated":"2024-05-24T22:33:04Z","snapshot_observed_at":"2026-08-20T13:48:07.834342Z","submitted_at":"2022-05-20T17:42:38Z","title":"A Review of Safe Reinforcement Learning: Methods, Theory and Applications","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.10330","snapshot_observed_at":"2026-08-11T11:30:06.680248Z","title":"arXiv preprint arXiv:2205.10330","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.15429","last_updated":"2025-04-19T01:50:15Z","snapshot_observed_at":"2026-08-18T09:57:37.837649Z","submitted_at":"2024-12-19T22:29:03Z","title":"Offline Safe Reinforcement Learning Using Trajectory Classification","version":5},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-11T11:30:06.680248Z"},"links":{"cited_paper":"/paper/2205.10330","citing_paper":"/paper/2412.15429"},"observation_digest":"sha256:10bfe529d81633f61201c7f22e521bf057cd633f4d6bebd131c8543172e5c82e","observation_id":"8e6c6fc6-97fe-4f05-9690-46f1434fec3a","resolution":{"observed_at":"2026-08-11T11:30:06.680248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.09304","last_updated":"2023-05-16T09:22:14Z","snapshot_observed_at":"2026-08-16T15:32:44.347057Z","submitted_at":"2023-05-16T09:22:14Z","title":"OmniSafe: An Infrastructure for Accelerating Safe Reinforcement Learning Research","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.09304","snapshot_observed_at":"2026-08-11T11:30:06.685475Z","title":"arXiv preprint arXiv:2305.09304","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.15429","last_updated":"2025-04-19T01:50:15Z","snapshot_observed_at":"2026-08-18T09:57:37.837649Z","submitted_at":"2024-12-19T22:29:03Z","title":"Offline Safe Reinforcement Learning Using Trajectory Classification","version":5},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-11T11:30:06.685475Z"},"links":{"cited_paper":"/paper/2305.09304","citing_paper":"/paper/2412.15429"},"observation_digest":"sha256:25af2976654470ab1199264a1a17cf8972e65f08815e88ea723d179b39dd7d4c","observation_id":"9ee70c93-8be7-428c-8750-68b977ed3737","resolution":{"observed_at":"2026-08-11T11:30:06.685475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01306","last_updated":"2024-11-19T18:12:45Z","snapshot_observed_at":"2026-08-17T15:29:47.883677Z","submitted_at":"2024-02-02T10:53:36Z","title":"KTO: Model Alignment as Prospect Theoretic Optimization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01306","snapshot_observed_at":"2026-08-11T11:30:06.659787Z","title":"arXiv preprint arXiv:2402.01306","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.15429","last_updated":"2025-04-19T01:50:15Z","snapshot_observed_at":"2026-08-18T09:57:37.837649Z","submitted_at":"2024-12-19T22:29:03Z","title":"Offline Safe Reinforcement Learning Using Trajectory Classification","version":5},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-11T11:30:06.659787Z"},"links":{"cited_paper":"/paper/2402.01306","citing_paper":"/paper/2412.15429"},"observation_digest":"sha256:92b41ed54219142e27281ac9c4f108991b897c3827d076bc8ec41b7152b29832","observation_id":"a060bc4d-1403-4f04-a38f-6a69ccc63fe3","resolution":{"observed_at":"2026-08-11T11:30:06.659787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.15429","last_updated":"2025-04-19T01:50:15Z","latest_version":5,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-18T09:57:37.837649Z","submitted_at":"2024-12-19T22:29:03Z","title":"Offline Safe Reinforcement Learning Using Trajectory Classification"},"reference_resolution":{"displayed":13,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":9,"verified_exact":0,"verified_fuzzy":3},"total_outbound_references":13},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 13 of 13 outbound references and 0 inbound Pith citation observations for arXiv:2412.15429."}