{"as_of":"2026-08-19T09:33:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f968b4def500055e002523227878d35f24eda39247592858d5cc054662d25ee2","coverage":[{"denominator":22,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":22,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T21:45:25.203483Z","state":"measured"},{"denominator":24,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":24,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T10:19:07.791607Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T03:16:33.829615Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.04228","last_updated":"2025-01-09T01:35:56Z","snapshot_observed_at":"2026-08-17T20:03:07.657868Z","submitted_at":"2025-01-08T01:59:47Z","title":"Constraints as Rewards: Reinforcement Learning for Robots without Reward Functions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.04228","snapshot_observed_at":"2026-08-04T10:19:07.791607Z","title":"Constraints as rewards: Reinforcement learning for robots without reward functions.arXiv preprint arXiv:2501.04228, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.10759","last_updated":"2026-06-21T14:38:07Z","snapshot_observed_at":"2026-08-08T15:13:21.218682Z","submitted_at":"2025-10-12T18:58:59Z","title":"Gain Tuning Is Not What You Need: Reward Gain Adaptation for Constrained Locomotion Learning","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T10:19:07.791607Z"},"links":{"cited_paper":"/paper/2501.04228","citing_paper":"/paper/2510.10759"},"observation_digest":"sha256:b18984fac0c984bcb50009d053ccb4b71f6cf145df68e6456e56b6fa712a21a5","observation_id":"dbf013d3-9484-45d5-972c-d17b4d67a52c","resolution":{"observed_at":"2026-08-04T10:19:07.791607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04228","last_updated":"2025-01-09T01:35:56Z","snapshot_observed_at":"2026-08-17T20:03:07.657868Z","submitted_at":"2025-01-08T01:59:47Z","title":"Constraints as Rewards: Reinforcement Learning for Robots without Reward Functions","version":2},"cited_work":{"arxiv_id":"2501.04228","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.04228","snapshot_observed_at":"2026-07-02T03:16:33.829615Z","title":"arXiv preprint arXiv:2501.04228 (2025)","venue":null,"work_id":"614ebc70-1bb2-4380-a382-36fd90df87c0","year":2025},"citing_paper":{"arxiv_id":"2606.03177","last_updated":"2026-06-15T21:39:17Z","snapshot_observed_at":"2026-08-15T04:06:38.945421Z","submitted_at":"2026-06-02T05:31:32Z","title":"ConTrack: Constrained Hand Motion Tracking with Adaptive Trade-off Control","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-28T10:13:29.399114Z"},"links":{"cited_paper":"/paper/2501.04228","citing_paper":"/paper/2606.03177"},"observation_digest":"sha256:f1deb41e12c341dadddd88bf54dc2e30ab83729107e9996edabadc91dfcbd43f","observation_id":"d4d97c39-604e-4831-912e-05562f8fc141","resolution":{"observed_at":"2026-07-02T03:16:33.831410Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2501.04228/citation-record","integrity":"/paper/2501.04228/integrity","json":"/paper/2501.04228/citation-record.json","paper":"/paper/2501.04228"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:45:25.650108Z","title":"Learning bipedal robot locomotion from hu- man movement,","venue":null,"work_id":"d7b441a4-4785-4a94-b997-c48213e4d85f","year":2021},"citing_paper":{"arxiv_id":"2501.04228","last_updated":"2025-01-09T01:35:56Z","snapshot_observed_at":"2026-08-17T20:03:07.657868Z","submitted_at":"2025-01-08T01:59:47Z","title":"Constraints as Rewards: Reinforcement Learning for Robots without Reward Functions","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T21:45:25.078299Z"},"links":{"citing_paper":"/paper/2501.04228"},"observation_digest":"sha256:1f8804457100586ef0d651224b59665d250f8fb3c7d0cec360f63d7b3eeb4a83","observation_id":"92d3b4b9-1155-4786-a4eb-542f55e02170","resolution":{"observed_at":"2026-08-10T21:45:25.655529Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:45:25.085999Z","title":"Champion-level drone racing using deep reinforce- ment learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.04228","last_updated":"2025-01-09T01:35:56Z","snapshot_observed_at":"2026-08-17T20:03:07.657868Z","submitted_at":"2025-01-08T01:59:47Z","title":"Constraints as Rewards: Reinforcement Learning for Robots without Reward Functions","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T21:45:25.085999Z"},"links":{"citing_paper":"/paper/2501.04228"},"observation_digest":"sha256:0c3bd271d7904b458cb0f553fd32a874af9c0eae3f70d80eda7f337fd8d97e3b","observation_id":"782e5d4a-c734-4655-a320-abe655d516ed","resolution":{"observed_at":"2026-08-10T21:45:25.085999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:45:25.613632Z","title":"Robot parkour learning,","venue":null,"work_id":"2945c9b7-7d19-4c4f-a0c3-15ac8dbdafae","year":2023},"citing_paper":{"arxiv_id":"2501.04228","last_updated":"2025-01-09T01:35:56Z","snapshot_observed_at":"2026-08-17T20:03:07.657868Z","submitted_at":"2025-01-08T01:59:47Z","title":"Constraints as Rewards: Reinforcement Learning for Robots without Reward Functions","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T21:45:25.092430Z"},"links":{"citing_paper":"/paper/2501.04228"},"observation_digest":"sha256:c9da0b5315b3f11df236fb6739a35ca9d942e038f5390865590ec4fbd620a83f","observation_id":"47c9e932-1ae8-4a95-b932-98cd1696c037","resolution":{"observed_at":"2026-08-10T21:45:25.621452Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:45:25.591877Z","title":"Cat: Constraints as terminations for legged locomotion reinforcement learning,","venue":null,"work_id":"491e20fb-6bd9-4912-b83a-2b00edf1dcdc","year":2024},"citing_paper":{"arxiv_id":"2501.04228","last_updated":"2025-01-09T01:35:56Z","snapshot_observed_at":"2026-08-17T20:03:07.657868Z","submitted_at":"2025-01-08T01:59:47Z","title":"Constraints as Rewards: Reinforcement Learning for Robots without Reward Functions","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T21:45:25.099871Z"},"links":{"citing_paper":"/paper/2501.04228"},"observation_digest":"sha256:f0cd52b612d7794435e96cc75223a703eea56701188fec49b8ee4601f7510d48","observation_id":"05ee9a45-eb3b-418c-b5e4-1cff474b55bc","resolution":{"observed_at":"2026-08-10T21:45:25.600547Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:45:25.569670Z","title":"Learning agile and dynamic motor skills for legged robots,","venue":null,"work_id":"c8748ff6-d01f-4f31-9a38-d1b217f8c3e6","year":2019},"citing_paper":{"arxiv_id":"2501.04228","last_updated":"2025-01-09T01:35:56Z","snapshot_observed_at":"2026-08-17T20:03:07.657868Z","submitted_at":"2025-01-08T01:59:47Z","title":"Constraints as Rewards: Reinforcement Learning for Robots without Reward Functions","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T21:45:25.105866Z"},"links":{"citing_paper":"/paper/2501.04228"},"observation_digest":"sha256:fb81cc71c70becab83b0fa6b3d60e27fc40616424e4d05c99fd4808f4770f97a","observation_id":"4d3065f9-c25e-4600-baba-621c1bdd7c54","resolution":{"observed_at":"2026-08-10T21:45:25.576349Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:45:25.111129Z","title":"Boyd and L","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2501.04228","last_updated":"2025-01-09T01:35:56Z","snapshot_observed_at":"2026-08-17T20:03:07.657868Z","submitted_at":"2025-01-08T01:59:47Z","title":"Constraints as Rewards: Reinforcement Learning for Robots without Reward Functions","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T21:45:25.111129Z"},"links":{"citing_paper":"/paper/2501.04228"},"observation_digest":"sha256:2181e26134d57956976600af931f93e5eb3a0b8f72685009e4145e065f1eead5","observation_id":"4d97ea8c-2be4-4b20-9e3f-d2041527e3a9","resolution":{"observed_at":"2026-08-10T21:45:25.111129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:45:25.536354Z","title":"Outracing champion gran turismo drivers with deep reinforcement learning,","venue":null,"work_id":"1174f741-d5ed-4a66-8c45-9f0a6ff022b8","year":2022},"citing_paper":{"arxiv_id":"2501.04228","last_updated":"2025-01-09T01:35:56Z","snapshot_observed_at":"2026-08-17T20:03:07.657868Z","submitted_at":"2025-01-08T01:59:47Z","title":"Constraints as Rewards: Reinforcement Learning for Robots without Reward Functions","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T21:45:25.117310Z"},"links":{"citing_paper":"/paper/2501.04228"},"observation_digest":"sha256:091cc8bae44c0a8f66de77f9732014c42d181190d98db52da4448faab48b696e","observation_id":"30f58679-35a3-45c8-9960-f469244af536","resolution":{"observed_at":"2026-08-10T21:45:25.542087Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:45:25.517272Z","title":"Benchmarking safe exploration in deep reinforcement learning,","venue":null,"work_id":"694f0cd6-c991-4aec-bb4b-e25896fcb3a5","year":2019},"citing_paper":{"arxiv_id":"2501.04228","last_updated":"2025-01-09T01:35:56Z","snapshot_observed_at":"2026-08-17T20:03:07.657868Z","submitted_at":"2025-01-08T01:59:47Z","title":"Constraints as Rewards: Reinforcement Learning for Robots without Reward Functions","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T21:45:25.123540Z"},"links":{"citing_paper":"/paper/2501.04228"},"observation_digest":"sha256:68fa0bc1053cbcf360c23c594fc8723b53098e3dee22c3e9a7ed668d72b57f83","observation_id":"3e4678e9-4e2d-4507-8ed2-909b1a95fe8f","resolution":{"observed_at":"2026-08-10T21:45:25.524122Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:45:25.493752Z","title":"Learning to walk in the real world with minimal human effort,","venue":null,"work_id":"67373f1e-b88b-470c-bab6-75fe403a4ce4","year":2020},"citing_paper":{"arxiv_id":"2501.04228","last_updated":"2025-01-09T01:35:56Z","snapshot_observed_at":"2026-08-17T20:03:07.657868Z","submitted_at":"2025-01-08T01:59:47Z","title":"Constraints as Rewards: Reinforcement Learning for Robots without Reward Functions","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T21:45:25.128084Z"},"links":{"citing_paper":"/paper/2501.04228"},"observation_digest":"sha256:7eb654caffeb0a2f643d34650bcdc05ba57374253effbbdb5b3ddd14ba17bf59","observation_id":"b3d1eaa7-b688-478c-a441-deebc05e5eda","resolution":{"observed_at":"2026-08-10T21:45:25.503746Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:45:25.475716Z","title":"Real-time perceptive motion control using control barrier functions with analytical smoothing for six-wheeled- telescopic-legged robot tachyon 3,","venue":null,"work_id":"a38c7c28-fdf6-4e54-8776-4bed6817b3ef","year":2024},"citing_paper":{"arxiv_id":"2501.04228","last_updated":"2025-01-09T01:35:56Z","snapshot_observed_at":"2026-08-17T20:03:07.657868Z","submitted_at":"2025-01-08T01:59:47Z","title":"Constraints as Rewards: Reinforcement Learning for Robots without Reward Functions","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T21:45:25.132783Z"},"links":{"citing_paper":"/paper/2501.04228"},"observation_digest":"sha256:b2c4bca8239a2a7238e2d38646408df97f74231d4d59d46a5a90851e979850f0","observation_id":"df298fa6-1a0d-4429-b293-1291f4804733","resolution":{"observed_at":"2026-08-10T21:45:25.481481Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:45:25.459556Z","title":"A comprehensive survey on safe reinforcement learning,","venue":null,"work_id":"5d36f889-2de1-4e20-a95f-1a7077cdf8db","year":2015},"citing_paper":{"arxiv_id":"2501.04228","last_updated":"2025-01-09T01:35:56Z","snapshot_observed_at":"2026-08-17T20:03:07.657868Z","submitted_at":"2025-01-08T01:59:47Z","title":"Constraints as Rewards: Reinforcement Learning for Robots without Reward Functions","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T21:45:25.137072Z"},"links":{"citing_paper":"/paper/2501.04228"},"observation_digest":"sha256:d5b4a8ba91d776a680cca953ad0f9588f2f25e52f863d5ae15baa29d49bd12da","observation_id":"3fa21293-a985-42d6-8719-ee76c72cf5a8","resolution":{"observed_at":"2026-08-10T21:45:25.464542Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:45:25.442090Z","title":"Penalized proximal policy optimization for safe reinforcement learning,","venue":null,"work_id":"59d4555d-186f-4497-967b-8168ebb80680","year":2022},"citing_paper":{"arxiv_id":"2501.04228","last_updated":"2025-01-09T01:35:56Z","snapshot_observed_at":"2026-08-17T20:03:07.657868Z","submitted_at":"2025-01-08T01:59:47Z","title":"Constraints as Rewards: Reinforcement Learning for Robots without Reward Functions","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T21:45:25.144171Z"},"links":{"citing_paper":"/paper/2501.04228"},"observation_digest":"sha256:a3ea3f00f148891008cd30fa43e033a3dc02379f741c5b8443e398d254bd521b","observation_id":"1ed1db81-1518-4574-945c-70f195a06df1","resolution":{"observed_at":"2026-08-10T21:45:25.447305Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:45:25.424203Z","title":"Robot reinforcement learning on the constraint manifold,","venue":null,"work_id":"a8a207a0-4866-4e09-8922-a5f4db8c387b","year":2022},"citing_paper":{"arxiv_id":"2501.04228","last_updated":"2025-01-09T01:35:56Z","snapshot_observed_at":"2026-08-17T20:03:07.657868Z","submitted_at":"2025-01-08T01:59:47Z","title":"Constraints as Rewards: Reinforcement Learning for Robots without Reward Functions","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T21:45:25.150252Z"},"links":{"citing_paper":"/paper/2501.04228"},"observation_digest":"sha256:8f5a7fd67cc9a5ce4ce98d8624747e9c987ad628e7635029c0246d6e2f72737a","observation_id":"1d220833-10d0-48ae-827a-f031901482a4","resolution":{"observed_at":"2026-08-10T21:45:25.429887Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:45:25.406045Z","title":"Trust region policy optimization,","venue":null,"work_id":"d72a5a8d-6448-46e5-b2b7-b7ef252edb3d","year":2015},"citing_paper":{"arxiv_id":"2501.04228","last_updated":"2025-01-09T01:35:56Z","snapshot_observed_at":"2026-08-17T20:03:07.657868Z","submitted_at":"2025-01-08T01:59:47Z","title":"Constraints as Rewards: Reinforcement Learning for Robots without Reward Functions","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T21:45:25.155601Z"},"links":{"citing_paper":"/paper/2501.04228"},"observation_digest":"sha256:de13f286bc68b43b1a77f6fc6fbe0e995a3f4cc300476a7fc6c85423bba2003d","observation_id":"c8e2244b-9576-455f-b932-b0162063d5fd","resolution":{"observed_at":"2026-08-10T21:45:25.411592Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-15T20:26:32.102285Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-10T21:45:25.161838Z","title":"Proximal policy optimization algorithms,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.04228","last_updated":"2025-01-09T01:35:56Z","snapshot_observed_at":"2026-08-17T20:03:07.657868Z","submitted_at":"2025-01-08T01:59:47Z","title":"Constraints as Rewards: Reinforcement Learning for Robots without Reward Functions","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T21:45:25.161838Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2501.04228"},"observation_digest":"sha256:1257c16756219ed23fcc91e195f12a3762ee6bde5201c947bb3439d4db77c842","observation_id":"8f508334-3915-499e-b54b-e4974a34f184","resolution":{"observed_at":"2026-08-10T21:45:25.161838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:45:25.389204Z","title":"Soft actor-critic: Off-policy maximum entropy deep reinforcement learning with a stochastic actor,","venue":null,"work_id":"7f85ad12-c7b7-4883-a0c7-15649ac82a1c","year":2018},"citing_paper":{"arxiv_id":"2501.04228","last_updated":"2025-01-09T01:35:56Z","snapshot_observed_at":"2026-08-17T20:03:07.657868Z","submitted_at":"2025-01-08T01:59:47Z","title":"Constraints as Rewards: Reinforcement Learning for Robots without Reward Functions","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T21:45:25.167951Z"},"links":{"citing_paper":"/paper/2501.04228"},"observation_digest":"sha256:ac4091be61396439a7b966057a79e3d4cb0f9c52f92d631154c00a51d9ea8072","observation_id":"6926126d-7005-4594-a378-1e7494faa967","resolution":{"observed_at":"2026-08-10T21:45:25.394471Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-17T07:51:41.384508Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.05905","snapshot_observed_at":"2026-08-10T21:45:25.174248Z","title":"Soft actor-critic algorithms and applications,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.04228","last_updated":"2025-01-09T01:35:56Z","snapshot_observed_at":"2026-08-17T20:03:07.657868Z","submitted_at":"2025-01-08T01:59:47Z","title":"Constraints as Rewards: Reinforcement Learning for Robots without Reward Functions","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T21:45:25.174248Z"},"links":{"cited_paper":"/paper/1812.05905","citing_paper":"/paper/2501.04228"},"observation_digest":"sha256:7e735cd99bf21cdbc5c03a5b578f8c109184531a3e0b290a336c1f5409e52ceb","observation_id":"969e9470-17bd-4080-bae2-80fc4a7e5ba6","resolution":{"observed_at":"2026-08-10T21:45:25.174248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15430","last_updated":"2023-09-27T06:49:20Z","snapshot_observed_at":"2026-08-18T00:25:30.906802Z","submitted_at":"2023-09-27T06:49:20Z","title":"Evaluation of Constrained Reinforcement Learning Algorithms for Legged Locomotion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15430","snapshot_observed_at":"2026-08-10T21:45:25.180371Z","title":"Evaluation of constrained reinforcement learning algorithms for legged locomotion,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.04228","last_updated":"2025-01-09T01:35:56Z","snapshot_observed_at":"2026-08-17T20:03:07.657868Z","submitted_at":"2025-01-08T01:59:47Z","title":"Constraints as Rewards: Reinforcement Learning for Robots without Reward Functions","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T21:45:25.180371Z"},"links":{"cited_paper":"/paper/2309.15430","citing_paper":"/paper/2501.04228"},"observation_digest":"sha256:f35c8aee787676453065be5c10cceb7826767b87fd077d3e32fe0d0262625ef3","observation_id":"bcd72484-cc04-45d8-bd31-f07be145c0e0","resolution":{"observed_at":"2026-08-10T21:45:25.180371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:45:25.370177Z","title":"Learning agile soccer skills for a bipedal robot with deep reinforcement learning,","venue":null,"work_id":"f5f36161-02b8-4961-8aeb-7b02267b2d4c","year":2024},"citing_paper":{"arxiv_id":"2501.04228","last_updated":"2025-01-09T01:35:56Z","snapshot_observed_at":"2026-08-17T20:03:07.657868Z","submitted_at":"2025-01-08T01:59:47Z","title":"Constraints as Rewards: Reinforcement Learning for Robots without Reward Functions","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T21:45:25.187371Z"},"links":{"citing_paper":"/paper/2501.04228"},"observation_digest":"sha256:f33ce2b9412f6f091a93e79d8f0184a5efa663c7d0f90506c62cb3b9b377ccae","observation_id":"9583058d-0c6f-461e-b780-f2560d46d777","resolution":{"observed_at":"2026-08-10T21:45:25.377392Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:45:25.352471Z","title":null,"venue":null,"work_id":"f0c9c156-5f39-4adf-90a7-ce5ba4e984b1","year":2018},"citing_paper":{"arxiv_id":"2501.04228","last_updated":"2025-01-09T01:35:56Z","snapshot_observed_at":"2026-08-17T20:03:07.657868Z","submitted_at":"2025-01-08T01:59:47Z","title":"Constraints as Rewards: Reinforcement Learning for Robots without Reward Functions","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T21:45:25.192744Z"},"links":{"citing_paper":"/paper/2501.04228"},"observation_digest":"sha256:d4d07254a60ad0a78b40cc68cff688f615e7dad950a89524463495f340aa3722","observation_id":"4a8ee6c1-620f-470a-9e91-3a2feda6f2ac","resolution":{"observed_at":"2026-08-10T21:45:25.357798Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:45:25.332232Z","title":"Mujoco: A physics engine for model-based control","venue":null,"work_id":"1c866146-9066-4b5c-a5ed-9ec8fcb7b8f4","year":2012},"citing_paper":{"arxiv_id":"2501.04228","last_updated":"2025-01-09T01:35:56Z","snapshot_observed_at":"2026-08-17T20:03:07.657868Z","submitted_at":"2025-01-08T01:59:47Z","title":"Constraints as Rewards: Reinforcement Learning for Robots without Reward Functions","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T21:45:25.198253Z"},"links":{"citing_paper":"/paper/2501.04228"},"observation_digest":"sha256:716f73e49231540e0da2d10e75784fea6d9793e97247d3fccab0a6168e59b53c","observation_id":"65c9b896-690b-4eb7-a4d9-829137c734de","resolution":{"observed_at":"2026-08-10T21:45:25.339663Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1606.01540","last_updated":"2016-06-05T17:54:48Z","snapshot_observed_at":"2026-08-13T12:26:05.192883Z","submitted_at":"2016-06-05T17:54:48Z","title":"OpenAI Gym","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.01540","snapshot_observed_at":"2026-08-10T21:45:25.203483Z","title":"Openai gym,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.04228","last_updated":"2025-01-09T01:35:56Z","snapshot_observed_at":"2026-08-17T20:03:07.657868Z","submitted_at":"2025-01-08T01:59:47Z","title":"Constraints as Rewards: Reinforcement Learning for Robots without Reward Functions","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T21:45:25.203483Z"},"links":{"cited_paper":"/paper/1606.01540","citing_paper":"/paper/2501.04228"},"observation_digest":"sha256:cd05ce78e2e05de99fb78f04d1417c7d643221fc2927a81fd96cc7a38d067e4e","observation_id":"e4227e1d-006e-42d8-92af-336324b21b7a","resolution":{"observed_at":"2026-08-10T21:45:25.203483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2501.04228","last_updated":"2025-01-09T01:35:56Z","latest_version":2,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-17T20:03:07.657868Z","submitted_at":"2025-01-08T01:59:47Z","title":"Constraints as Rewards: Reinforcement Learning for Robots without Reward Functions"},"reference_resolution":{"displayed":22,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":7,"verified_exact":0,"verified_fuzzy":15},"total_outbound_references":22},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 22 of 22 outbound references and 2 inbound Pith citation observations for arXiv:2501.04228."}