{"as_of":"2026-08-15T07:46:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e9124a32fa8ace1eecd7bff24a9e3762bef792e66450705dcedcf06040cecd42","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":30,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":30,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":30,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":30,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T18:52:14.128108Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T19:40:05.986446Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"1910.07207","last_updated":"2019-10-18T09:17:44Z","snapshot_observed_at":"2026-08-14T00:35:36.804755Z","submitted_at":"2019-10-16T08:11:08Z","title":"Soft Actor-Critic for Discrete Action Settings","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.07207","snapshot_observed_at":"2026-08-12T18:52:14.128108Z","title":"Soft actor-critic for discrete action settings","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2411.11188","last_updated":"2024-11-17T22:25:40Z","snapshot_observed_at":"2026-08-15T05:51:00.512693Z","submitted_at":"2024-11-17T22:25:40Z","title":"AMAGO-2: Breaking the Multi-Task Barrier in Meta-Reinforcement Learning with Transformers","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-12T18:52:14.128108Z"},"links":{"cited_paper":"/paper/1910.07207","citing_paper":"/paper/2411.11188"},"observation_digest":"sha256:0aafe014d08f420fcd3ff738f965c89eba4f51ad80f913c8eda7694a9d101b02","observation_id":"67f86b76-e5df-433a-9d5b-4d957e1c4d7f","resolution":{"observed_at":"2026-08-12T18:52:14.128108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.07207","last_updated":"2019-10-18T09:17:44Z","snapshot_observed_at":"2026-08-14T00:35:36.804755Z","submitted_at":"2019-10-16T08:11:08Z","title":"Soft Actor-Critic for Discrete Action Settings","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.07207","snapshot_observed_at":"2026-08-12T10:52:50.944478Z","title":null,"venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2412.10381","last_updated":"2025-05-26T03:49:37Z","snapshot_observed_at":"2026-08-15T04:03:52.427557Z","submitted_at":"2024-11-28T04:06:02Z","title":"Supervised Learning-enhanced Multi-Group Actor Critic for Live Stream Allocation in Feed","version":6},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-12T10:52:50.944478Z"},"links":{"cited_paper":"/paper/1910.07207","citing_paper":"/paper/2412.10381"},"observation_digest":"sha256:c5664145629138d39b07b56b922615491da6653155a49635f397fb12cadf6b31","observation_id":"ea992a80-c1bd-4a3e-9791-c4d206ad2e72","resolution":{"observed_at":"2026-08-12T10:52:50.944478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.07207","last_updated":"2019-10-18T09:17:44Z","snapshot_observed_at":"2026-08-14T00:35:36.804755Z","submitted_at":"2019-10-16T08:11:08Z","title":"Soft Actor-Critic for Discrete Action Settings","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.07207","snapshot_observed_at":"2026-08-10T11:08:53.322150Z","title":"Soft actor-critic for discrete action settings,","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2501.16733","last_updated":"2025-01-28T06:18:29Z","snapshot_observed_at":"2026-08-15T07:36:46.231285Z","submitted_at":"2025-01-28T06:18:29Z","title":"Dream to Drive with Predictive Individual World Model","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-10T11:08:53.322150Z"},"links":{"cited_paper":"/paper/1910.07207","citing_paper":"/paper/2501.16733"},"observation_digest":"sha256:f4115d4215b386899eb4ecb1d702db286f250b91be986a1aeb6ade96d4a4a4ca","observation_id":"6202d432-773c-4208-affb-58f1ba6d27dc","resolution":{"observed_at":"2026-08-10T11:08:53.322150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.07207","last_updated":"2019-10-18T09:17:44Z","snapshot_observed_at":"2026-08-14T00:35:36.804755Z","submitted_at":"2019-10-16T08:11:08Z","title":"Soft Actor-Critic for Discrete Action Settings","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.07207","snapshot_observed_at":"2026-08-09T21:16:56.312627Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.19133","last_updated":"2025-01-31T13:38:57Z","snapshot_observed_at":"2026-08-14T19:04:38.121616Z","submitted_at":"2025-01-31T13:38:57Z","title":"Decorrelated Soft Actor-Critic for Efficient Deep Reinforcement Learning","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-09T21:16:56.312627Z"},"links":{"cited_paper":"/paper/1910.07207","citing_paper":"/paper/2501.19133"},"observation_digest":"sha256:e3a3224abdd4a43aaccdd5ba2bf42053754c813d81dfd7a64b39e77d85fe7ef6","observation_id":"ebce658c-c843-4fdb-a824-5f93eff0308e","resolution":{"observed_at":"2026-08-09T21:16:56.312627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.07207","last_updated":"2019-10-18T09:17:44Z","snapshot_observed_at":"2026-08-14T00:35:36.804755Z","submitted_at":"2019-10-16T08:11:08Z","title":"Soft Actor-Critic for Discrete Action Settings","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.07207","snapshot_observed_at":"2026-08-08T21:39:25.525912Z","title":"Soft actor-critic for discrete action settings","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2502.04778","last_updated":"2025-05-29T09:14:17Z","snapshot_observed_at":"2026-08-10T06:15:46.116639Z","submitted_at":"2025-02-07T09:30:35Z","title":"Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-08T21:39:25.525912Z"},"links":{"cited_paper":"/paper/1910.07207","citing_paper":"/paper/2502.04778"},"observation_digest":"sha256:1433ed9ca2f44ff21c0e4d2f7db1b3faf50bb2a0802ed87ab441a29fe9df52fa","observation_id":"297a5d88-0833-4fa6-9b98-c16ed13bda4e","resolution":{"observed_at":"2026-08-08T21:39:25.525912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.07207","last_updated":"2019-10-18T09:17:44Z","snapshot_observed_at":"2026-08-14T00:35:36.804755Z","submitted_at":"2019-10-16T08:11:08Z","title":"Soft Actor-Critic for Discrete Action Settings","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.07207","snapshot_observed_at":"2026-08-07T10:53:10.179732Z","title":"Christodoulou","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2506.04147","last_updated":"2026-07-17T06:06:23Z","snapshot_observed_at":"2026-08-14T09:26:04.339676Z","submitted_at":"2025-06-04T16:41:55Z","title":"SLAC: Safe and Efficient Real-Robot Reinforcement Learning via Unsupervised Simulation Pre-Training","version":5},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:10.179732Z"},"links":{"cited_paper":"/paper/1910.07207","citing_paper":"/paper/2506.04147"},"observation_digest":"sha256:4c0bf225387301533d71a5b1d5b43ee508df98dead6d9b0a1f6ad1c00b0cd1f6","observation_id":"5e975619-5ca9-4778-966f-6b1b82faa63c","resolution":{"observed_at":"2026-08-07T10:53:10.179732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.07207","last_updated":"2019-10-18T09:17:44Z","snapshot_observed_at":"2026-08-14T00:35:36.804755Z","submitted_at":"2019-10-16T08:11:08Z","title":"Soft Actor-Critic for Discrete Action Settings","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.07207","snapshot_observed_at":"2026-08-07T04:47:14.935311Z","title":"Soft actor-critic for discrete action settings,","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2506.09859","last_updated":"2025-07-23T08:56:08Z","snapshot_observed_at":"2026-08-13T16:25:08.513993Z","submitted_at":"2025-06-11T15:31:25Z","title":"Hierarchical Learning-Enhanced MPC for Safe Crowd Navigation with Heterogeneous Constraints","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T04:47:14.935311Z"},"links":{"cited_paper":"/paper/1910.07207","citing_paper":"/paper/2506.09859"},"observation_digest":"sha256:fd86f7e48c48d9e17c6fe60a52b624852770d3d739136c634e3342b6373d60fd","observation_id":"c81fe141-3c17-4314-a79f-5993e0643127","resolution":{"observed_at":"2026-08-07T04:47:14.935311Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.07207","last_updated":"2019-10-18T09:17:44Z","snapshot_observed_at":"2026-08-14T00:35:36.804755Z","submitted_at":"2019-10-16T08:11:08Z","title":"Soft Actor-Critic for Discrete Action Settings","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.07207","snapshot_observed_at":"2026-08-06T23:49:14.797853Z","title":"Soft actor-critic for discrete action settings,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.16336","last_updated":"2025-06-19T14:14:55Z","snapshot_observed_at":"2026-08-14T17:59:48.040630Z","submitted_at":"2025-06-19T14:14:55Z","title":"Goal-conditioned Hierarchical Reinforcement Learning for Sample-efficient and Safe Autonomous Driving at Intersections","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:14.797853Z"},"links":{"cited_paper":"/paper/1910.07207","citing_paper":"/paper/2506.16336"},"observation_digest":"sha256:908d8146ce6b2c054da5c0b4b61a3b346faf7b87216568e6d7847f77bb83efcd","observation_id":"7b6c6c6b-ad19-4b2e-8a59-d6bf083e2595","resolution":{"observed_at":"2026-08-06T23:49:14.797853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.07207","last_updated":"2019-10-18T09:17:44Z","snapshot_observed_at":"2026-08-14T00:35:36.804755Z","submitted_at":"2019-10-16T08:11:08Z","title":"Soft Actor-Critic for Discrete Action Settings","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.07207","snapshot_observed_at":"2026-08-06T23:21:19.534851Z","title":"Soft actor-critic for discrete action settings","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2506.18627","last_updated":"2025-06-23T13:34:27Z","snapshot_observed_at":"2026-08-09T03:06:58.352320Z","submitted_at":"2025-06-23T13:34:27Z","title":"Multi-Agent Reinforcement Learning for Inverse Design in Photonic Integrated Circuits","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T23:21:19.534851Z"},"links":{"cited_paper":"/paper/1910.07207","citing_paper":"/paper/2506.18627"},"observation_digest":"sha256:d757ae57210347b20b24d8d1b964830fa168bce608fc156e95e23f699f3f5b02","observation_id":"7a9a86bb-cec3-4ae3-a691-68ba02f6f199","resolution":{"observed_at":"2026-08-06T23:21:19.534851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.07207","last_updated":"2019-10-18T09:17:44Z","snapshot_observed_at":"2026-08-14T00:35:36.804755Z","submitted_at":"2019-10-16T08:11:08Z","title":"Soft Actor-Critic for Discrete Action Settings","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.07207","snapshot_observed_at":"2026-08-06T19:09:05.218895Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.06499","last_updated":"2025-07-09T02:52:44Z","snapshot_observed_at":"2026-08-13T12:30:52.373947Z","submitted_at":"2025-07-09T02:52:44Z","title":"Learning To Communicate Over An Unknown Shared Network","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T19:09:05.218895Z"},"links":{"cited_paper":"/paper/1910.07207","citing_paper":"/paper/2507.06499"},"observation_digest":"sha256:19f92c159800d42e9b8116161377ee7882892ec39daf09d8c745088453771299","observation_id":"af61d2fc-ea81-4b3b-a899-4dd8e4a604de","resolution":{"observed_at":"2026-08-06T19:09:05.218895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.07207","last_updated":"2019-10-18T09:17:44Z","snapshot_observed_at":"2026-08-14T00:35:36.804755Z","submitted_at":"2019-10-16T08:11:08Z","title":"Soft Actor-Critic for Discrete Action Settings","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.07207","snapshot_observed_at":"2026-08-06T19:06:26.517932Z","title":"Soft actor-critic for discrete action settings","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2507.06615","last_updated":"2025-07-09T07:36:28Z","snapshot_observed_at":"2026-08-13T21:55:36.634753Z","submitted_at":"2025-07-09T07:36:28Z","title":"Efficient Multi-Task Reinforcement Learning with Cross-Task Policy Guidance","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T19:06:26.517932Z"},"links":{"cited_paper":"/paper/1910.07207","citing_paper":"/paper/2507.06615"},"observation_digest":"sha256:e1b50c6cede96615f0f2c5a44a073f8dd14f6b7d0f5d4b8efe079a1a5db634b1","observation_id":"9de1f464-3e53-4755-8767-6d82f0270712","resolution":{"observed_at":"2026-08-06T19:06:26.517932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.07207","last_updated":"2019-10-18T09:17:44Z","snapshot_observed_at":"2026-08-14T00:35:36.804755Z","submitted_at":"2019-10-16T08:11:08Z","title":"Soft Actor-Critic for Discrete Action Settings","version":2},"cited_work":{"arxiv_id":"1910.07207","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1910.07207","snapshot_observed_at":"2026-07-04T19:40:05.986446Z","title":"arXiv:1910.07207 [cs, stat] , author =","venue":null,"work_id":"684554b0-ea6b-4199-b360-8e61b4bd9971","year":1910},"citing_paper":{"arxiv_id":"2507.11019","last_updated":"2026-04-10T20:59:50Z","snapshot_observed_at":"2026-08-13T06:10:19.893970Z","submitted_at":"2025-07-15T06:24:07Z","title":"Relative Entropy Pathwise Policy Optimization","version":4},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-19T04:19:15.018380Z"},"links":{"cited_paper":"/paper/1910.07207","citing_paper":"/paper/2507.11019"},"observation_digest":"sha256:3daf379ddd75d0c0c3d9b61d32d10cf959a678f6970a5aa227c6d0efa8c61fec","observation_id":"50fb1378-d1f6-4cb1-9e71-21cdd1439884","resolution":{"observed_at":"2026-05-19T04:22:04.036090Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.07207","last_updated":"2019-10-18T09:17:44Z","snapshot_observed_at":"2026-08-14T00:35:36.804755Z","submitted_at":"2019-10-16T08:11:08Z","title":"Soft Actor-Critic for Discrete Action Settings","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.07207","snapshot_observed_at":"2026-08-06T17:24:29.206067Z","title":"Soft actor-critic for discrete action settings","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2507.11060","last_updated":"2025-07-15T07:54:04Z","snapshot_observed_at":"2026-08-11T01:41:02.526194Z","submitted_at":"2025-07-15T07:54:04Z","title":"Personalized Exercise Recommendation with Semantically-Grounded Knowledge Tracing","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T17:24:29.206067Z"},"links":{"cited_paper":"/paper/1910.07207","citing_paper":"/paper/2507.11060"},"observation_digest":"sha256:69190e79cb08f54defea3fb089848e7a57524473b5ca0f85faaf4afd5f5ccc3c","observation_id":"8a37a432-c78c-4615-a09a-5be87034d878","resolution":{"observed_at":"2026-08-06T17:24:29.206067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.07207","last_updated":"2019-10-18T09:17:44Z","snapshot_observed_at":"2026-08-14T00:35:36.804755Z","submitted_at":"2019-10-16T08:11:08Z","title":"Soft Actor-Critic for Discrete Action Settings","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.07207","snapshot_observed_at":"2026-08-06T14:11:03.043402Z","title":"Soft actor-critic for discrete action settings,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.19742","last_updated":"2025-07-26T02:22:54Z","snapshot_observed_at":"2026-08-11T06:16:17.967604Z","submitted_at":"2025-07-26T02:22:54Z","title":"DOA: A Degeneracy Optimization Agent with Adaptive Pose Compensation Capability based on Deep Reinforcement Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T14:11:03.043402Z"},"links":{"cited_paper":"/paper/1910.07207","citing_paper":"/paper/2507.19742"},"observation_digest":"sha256:883c00f704d119fe269cdd48d99ec2174dcf1e2e2e3706ee001aaf700759f71c","observation_id":"45a43ee0-7ece-4498-97a2-fe9732ceeb15","resolution":{"observed_at":"2026-08-06T14:11:03.043402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.07207","last_updated":"2019-10-18T09:17:44Z","snapshot_observed_at":"2026-08-14T00:35:36.804755Z","submitted_at":"2019-10-16T08:11:08Z","title":"Soft Actor-Critic for Discrete Action Settings","version":2},"cited_work":{"arxiv_id":"1910.07207","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1910.07207","snapshot_observed_at":"2026-07-04T19:40:05.986446Z","title":"arXiv:1910.07207 [cs, stat] , author =","venue":null,"work_id":"684554b0-ea6b-4199-b360-8e61b4bd9971","year":1910},"citing_paper":{"arxiv_id":"2509.09838","last_updated":"2026-05-11T21:29:26Z","snapshot_observed_at":"2026-08-14T23:52:17.710882Z","submitted_at":"2025-09-11T20:34:08Z","title":"Dissecting Discrete Soft Actor-Critic: Limitations and Principled Alternatives","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-05-18T17:05:36.100114Z"},"links":{"cited_paper":"/paper/1910.07207","citing_paper":"/paper/2509.09838"},"observation_digest":"sha256:d7926891eca8220fd2e2a6bcab60bf40b35df1946abeced240e9813c59117c4d","observation_id":"5ea9f523-b5a7-47d8-9b2a-551b021f2ce8","resolution":{"observed_at":"2026-05-18T17:06:39.804243Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.07207","last_updated":"2019-10-18T09:17:44Z","snapshot_observed_at":"2026-08-14T00:35:36.804755Z","submitted_at":"2019-10-16T08:11:08Z","title":"Soft Actor-Critic for Discrete Action Settings","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.07207","snapshot_observed_at":"2026-08-05T15:45:59.079116Z","title":"Soft actor-critic for discrete action settings","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2509.10474","last_updated":"2025-08-27T06:14:38Z","snapshot_observed_at":"2026-08-10T06:15:41.350184Z","submitted_at":"2025-08-27T06:14:38Z","title":"Generalizable Pareto-Optimal Offloading with Reinforcement Learning in Mobile Edge Computing","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:59.079116Z"},"links":{"cited_paper":"/paper/1910.07207","citing_paper":"/paper/2509.10474"},"observation_digest":"sha256:367ad29a73f89494605e6e2a03c78769612de461646e25afcacd79c492d383e7","observation_id":"fd073855-f9c5-42f0-b93a-14c5a3161913","resolution":{"observed_at":"2026-08-05T15:45:59.079116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.07207","last_updated":"2019-10-18T09:17:44Z","snapshot_observed_at":"2026-08-14T00:35:36.804755Z","submitted_at":"2019-10-16T08:11:08Z","title":"Soft Actor-Critic for Discrete Action Settings","version":2},"cited_work":{"arxiv_id":"1910.07207","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1910.07207","snapshot_observed_at":"2026-07-04T19:40:05.986446Z","title":"arXiv:1910.07207 [cs, stat] , author =","venue":null,"work_id":"684554b0-ea6b-4199-b360-8e61b4bd9971","year":1910},"citing_paper":{"arxiv_id":"2511.04320","last_updated":"2026-04-21T13:51:15Z","snapshot_observed_at":"2026-08-02T18:55:08.470325Z","submitted_at":"2025-11-06T12:47:33Z","title":"MacroNav: Multi-Task Context Representation Learning Enables Efficient Navigation in Unknown Environments","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-18T01:10:12.195443Z"},"links":{"cited_paper":"/paper/1910.07207","citing_paper":"/paper/2511.04320"},"observation_digest":"sha256:5bc6da1a59318f4205725351e02c4877289ba4e63546a83baade27930daa0873","observation_id":"6cd3e863-f66f-4f17-a3a8-b8df328c222a","resolution":{"observed_at":"2026-05-18T01:10:33.889159Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.07207","last_updated":"2019-10-18T09:17:44Z","snapshot_observed_at":"2026-08-14T00:35:36.804755Z","submitted_at":"2019-10-16T08:11:08Z","title":"Soft Actor-Critic for Discrete Action Settings","version":2},"cited_work":{"arxiv_id":"1910.07207","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1910.07207","snapshot_observed_at":"2026-07-04T19:40:05.986446Z","title":"arXiv:1910.07207 [cs, stat] , author =","venue":null,"work_id":"684554b0-ea6b-4199-b360-8e61b4bd9971","year":1910},"citing_paper":{"arxiv_id":"2511.17367","last_updated":"2026-05-14T11:57:30Z","snapshot_observed_at":"2026-08-05T22:02:12.858510Z","submitted_at":"2025-11-21T16:34:00Z","title":"R2PS: Worst-Case Robust Real-Time Pursuit Strategies under Partial Observability","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-17T20:19:24.841090Z"},"links":{"cited_paper":"/paper/1910.07207","citing_paper":"/paper/2511.17367"},"observation_digest":"sha256:effb4f435fd9a4329d7d31b11aa78a4a89ae14cbfc7045c120f384a71df5ddd4","observation_id":"16501943-0d04-4c7d-ad33-cb1a8e2a7d5e","resolution":{"observed_at":"2026-05-17T20:20:11.613626Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.07207","last_updated":"2019-10-18T09:17:44Z","snapshot_observed_at":"2026-08-14T00:35:36.804755Z","submitted_at":"2019-10-16T08:11:08Z","title":"Soft Actor-Critic for Discrete Action Settings","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.07207","snapshot_observed_at":"2026-07-13T14:51:03.626575Z","title":"Christodoulou, ”Soft actor-critic for discrete action settings”,arXiv preprint arXiv:1910.07207, 2019","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2604.00819","last_updated":"2026-06-03T06:05:54Z","snapshot_observed_at":"2026-08-14T15:55:27.774194Z","submitted_at":"2026-04-01T12:27:04Z","title":"Emotion Entanglement and Bayesian Inference for Multi-Dimensional Emotion Understanding","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-13T14:51:03.626575Z"},"links":{"cited_paper":"/paper/1910.07207","citing_paper":"/paper/2604.00819"},"observation_digest":"sha256:eb4a9a28b91bbf8e12cccae5f35c2968cbf471b4faf3613173c77396a2ec11df","observation_id":"b59e7892-1632-4b36-9df7-20360aefeeee","resolution":{"observed_at":"2026-07-13T14:51:03.626575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.07207","last_updated":"2019-10-18T09:17:44Z","snapshot_observed_at":"2026-08-14T00:35:36.804755Z","submitted_at":"2019-10-16T08:11:08Z","title":"Soft Actor-Critic for Discrete Action Settings","version":2},"cited_work":{"arxiv_id":"1910.07207","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1910.07207","snapshot_observed_at":"2026-07-04T19:40:05.986446Z","title":"arXiv:1910.07207 [cs, stat] , author =","venue":null,"work_id":"684554b0-ea6b-4199-b360-8e61b4bd9971","year":1910},"citing_paper":{"arxiv_id":"2605.22454","last_updated":"2026-05-21T13:19:50Z","snapshot_observed_at":"2026-08-13T01:57:32.400429Z","submitted_at":"2026-05-21T13:19:50Z","title":"Don't Forget the Critic: Value-Based Data Rehearsal for Multi-Cyclic Continual Reinforcement Learning","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-05-22T07:15:32.024198Z"},"links":{"cited_paper":"/paper/1910.07207","citing_paper":"/paper/2605.22454"},"observation_digest":"sha256:1ff73b75dc35957b85cc7b165c6fa031fbc720e410c15cd236a4a5c3587b5861","observation_id":"3f2a1f31-9eaf-4298-bd9e-47f1e69b87a8","resolution":{"observed_at":"2026-05-22T07:16:12.944273Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.07207","last_updated":"2019-10-18T09:17:44Z","snapshot_observed_at":"2026-08-14T00:35:36.804755Z","submitted_at":"2019-10-16T08:11:08Z","title":"Soft Actor-Critic for Discrete Action Settings","version":2},"cited_work":{"arxiv_id":"1910.07207","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1910.07207","snapshot_observed_at":"2026-07-04T19:40:05.986446Z","title":"arXiv:1910.07207 [cs, stat] , author =","venue":null,"work_id":"684554b0-ea6b-4199-b360-8e61b4bd9971","year":1910},"citing_paper":{"arxiv_id":"2606.05888","last_updated":"2026-06-04T08:57:45Z","snapshot_observed_at":"2026-08-09T12:01:33.602409Z","submitted_at":"2026-06-04T08:57:45Z","title":"Retry Policy Gradients in Continuous Action Spaces","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-28T01:44:37.492572Z"},"links":{"cited_paper":"/paper/1910.07207","citing_paper":"/paper/2606.05888"},"observation_digest":"sha256:cf3390b6ed0913e7d24eaa42635cb8d88eff5cbb06a9d7646b1e98b2c9f54490","observation_id":"4ce9cad1-9684-465b-a774-bee3b9e4f106","resolution":{"observed_at":"2026-07-02T12:56:57.023856Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.07207","last_updated":"2019-10-18T09:17:44Z","snapshot_observed_at":"2026-08-14T00:35:36.804755Z","submitted_at":"2019-10-16T08:11:08Z","title":"Soft Actor-Critic for Discrete Action Settings","version":2},"cited_work":{"arxiv_id":"1910.07207","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1910.07207","snapshot_observed_at":"2026-07-04T19:40:05.986446Z","title":"arXiv:1910.07207 [cs, stat] , author =","venue":null,"work_id":"684554b0-ea6b-4199-b360-8e61b4bd9971","year":1910},"citing_paper":{"arxiv_id":"2606.06272","last_updated":"2026-06-04T15:14:24Z","snapshot_observed_at":"2026-08-05T16:40:32.420875Z","submitted_at":"2026-06-04T15:14:24Z","title":"Your GFlowNet Secretly Learns an Optimal Transport Plan","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-06-28T02:35:08.323804Z"},"links":{"cited_paper":"/paper/1910.07207","citing_paper":"/paper/2606.06272"},"observation_digest":"sha256:49d8e17bbbc435ca86286dec8f14e602b89ce2a9cd28231b0513f0ad501f0af5","observation_id":"caf878c9-6fa1-4d62-9296-9b5c8914068b","resolution":{"observed_at":"2026-07-02T12:06:55.527589Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.07207","last_updated":"2019-10-18T09:17:44Z","snapshot_observed_at":"2026-08-14T00:35:36.804755Z","submitted_at":"2019-10-16T08:11:08Z","title":"Soft Actor-Critic for Discrete Action Settings","version":2},"cited_work":{"arxiv_id":"1910.07207","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1910.07207","snapshot_observed_at":"2026-07-04T19:40:05.986446Z","title":"arXiv:1910.07207 [cs, stat] , author =","venue":null,"work_id":"684554b0-ea6b-4199-b360-8e61b4bd9971","year":1910},"citing_paper":{"arxiv_id":"2606.09258","last_updated":"2026-06-08T09:30:38Z","snapshot_observed_at":"2026-08-06T20:35:52.838997Z","submitted_at":"2026-06-08T09:30:38Z","title":"Back to the Familiar Future: Failure Recovery for VLA Policies via Pre-Imagined Milestone Selection","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-27T16:42:49.740745Z"},"links":{"cited_paper":"/paper/1910.07207","citing_paper":"/paper/2606.09258"},"observation_digest":"sha256:fc219c02d4fc83b4e264b7e28dc81e7bd3f78ae8c07b5f071d69710fdde5b170","observation_id":"21e4be6e-28a0-418b-a2a5-a72dab9f0226","resolution":{"observed_at":"2026-07-03T01:17:30.764532Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.07207","last_updated":"2019-10-18T09:17:44Z","snapshot_observed_at":"2026-08-14T00:35:36.804755Z","submitted_at":"2019-10-16T08:11:08Z","title":"Soft Actor-Critic for Discrete Action Settings","version":2},"cited_work":{"arxiv_id":"1910.07207","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1910.07207","snapshot_observed_at":"2026-07-04T19:40:05.986446Z","title":"arXiv:1910.07207 [cs, stat] , author =","venue":null,"work_id":"684554b0-ea6b-4199-b360-8e61b4bd9971","year":1910},"citing_paper":{"arxiv_id":"2606.10705","last_updated":"2026-06-09T11:08:45Z","snapshot_observed_at":"2026-08-04T10:34:41.613730Z","submitted_at":"2026-06-09T11:08:45Z","title":"Event-Driven Reinforcement Learning Enables Long-Horizon Control in Semiconductor Fabrication","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-06-27T14:14:38.297507Z"},"links":{"cited_paper":"/paper/1910.07207","citing_paper":"/paper/2606.10705"},"observation_digest":"sha256:1471ad60918c4c5eb5733e0b276cac7f33fb6c270004c13c6756e183be2d8642","observation_id":"bfa06eaf-6f94-443d-af2f-9c75b1f544cf","resolution":{"observed_at":"2026-07-03T04:07:36.639368Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.07207","last_updated":"2019-10-18T09:17:44Z","snapshot_observed_at":"2026-08-14T00:35:36.804755Z","submitted_at":"2019-10-16T08:11:08Z","title":"Soft Actor-Critic for Discrete Action Settings","version":2},"cited_work":{"arxiv_id":"1910.07207","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1910.07207","snapshot_observed_at":"2026-07-04T19:40:05.986446Z","title":"arXiv:1910.07207 [cs, stat] , author =","venue":null,"work_id":"684554b0-ea6b-4199-b360-8e61b4bd9971","year":1910},"citing_paper":{"arxiv_id":"2606.21943","last_updated":"2026-06-20T08:20:41Z","snapshot_observed_at":"2026-07-06T23:56:54.959593Z","submitted_at":"2026-06-20T08:20:41Z","title":"Modularized Reinforcement Learning on LLMs: From MDP Creation to Exploration and Learning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-26T12:15:08.304150Z"},"links":{"cited_paper":"/paper/1910.07207","citing_paper":"/paper/2606.21943"},"observation_digest":"sha256:57c4945967f5e9e1e5b96082547aa227cbf0805c06f30431cc13004a9237ea60","observation_id":"1ac1056f-70e0-4e87-92f9-c9aba62a0250","resolution":{"observed_at":"2026-07-04T07:59:40.643542Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.07207","last_updated":"2019-10-18T09:17:44Z","snapshot_observed_at":"2026-08-14T00:35:36.804755Z","submitted_at":"2019-10-16T08:11:08Z","title":"Soft Actor-Critic for Discrete Action Settings","version":2},"cited_work":{"arxiv_id":"1910.07207","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1910.07207","snapshot_observed_at":"2026-07-04T19:40:05.986446Z","title":"arXiv:1910.07207 [cs, stat] , author =","venue":null,"work_id":"684554b0-ea6b-4199-b360-8e61b4bd9971","year":1910},"citing_paper":{"arxiv_id":"2606.25394","last_updated":"2026-06-24T04:45:09Z","snapshot_observed_at":"2026-08-12T20:02:00.798235Z","submitted_at":"2026-06-24T04:45:09Z","title":"FactorLibrary: From Polynomials to Circuits via Recursive Subgoals","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-06-25T21:12:22.718409Z"},"links":{"cited_paper":"/paper/1910.07207","citing_paper":"/paper/2606.25394"},"observation_digest":"sha256:37e71825f0e77ef518b09d1f0ea299cb717eee1d5bee5cab7042b2f766c0e224","observation_id":"18408309-491c-402f-9e55-7c8bf0147e3e","resolution":{"observed_at":"2026-07-04T19:40:05.988216Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.07207","last_updated":"2019-10-18T09:17:44Z","snapshot_observed_at":"2026-08-14T00:35:36.804755Z","submitted_at":"2019-10-16T08:11:08Z","title":"Soft Actor-Critic for Discrete Action Settings","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.07207","snapshot_observed_at":"2026-08-02T09:39:05.935795Z","title":"Petros Christodoulou","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.30072","last_updated":"2026-07-17T08:08:44Z","snapshot_observed_at":"2026-08-04T04:26:28.585666Z","submitted_at":"2026-06-29T10:04:15Z","title":"ACPO: Agent-Chained Policy Optimization for Multi-Agent Reinforcement Learning","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-02T09:39:05.935795Z"},"links":{"cited_paper":"/paper/1910.07207","citing_paper":"/paper/2606.30072"},"observation_digest":"sha256:c864fb822de7f37fbe35c9a17b2482bec313995e67cb00a4248b9a71fc7b828c","observation_id":"cc54dc00-345d-4228-9582-bdbcec8f327d","resolution":{"observed_at":"2026-08-02T09:39:05.935795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.07207","last_updated":"2019-10-18T09:17:44Z","snapshot_observed_at":"2026-08-14T00:35:36.804755Z","submitted_at":"2019-10-16T08:11:08Z","title":"Soft Actor-Critic for Discrete Action Settings","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.07207","snapshot_observed_at":"2026-08-01T06:15:18.525217Z","title":"Radial basis functions","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2607.22009","last_updated":"2026-07-24T06:14:59Z","snapshot_observed_at":"2026-08-15T01:47:30.825414Z","submitted_at":"2026-07-24T06:14:59Z","title":"Practical Graph Optimisation and AI-Driven Models for Active Directory Security Hardening","version":1},"reference_index":345,"source":"pdf_text","source_observed_at":"2026-08-01T06:15:18.525217Z"},"links":{"cited_paper":"/paper/1910.07207","citing_paper":"/paper/2607.22009"},"observation_digest":"sha256:aa3b22866a4ca3335a237492324a6acde22826b8654dc6772bb6a2d7c8fdec2b","observation_id":"406d8430-2d0c-4105-9d0e-a070b86eef4b","resolution":{"observed_at":"2026-08-01T06:15:18.525217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.07207","last_updated":"2019-10-18T09:17:44Z","snapshot_observed_at":"2026-08-14T00:35:36.804755Z","submitted_at":"2019-10-16T08:11:08Z","title":"Soft Actor-Critic for Discrete Action Settings","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.07207","snapshot_observed_at":"2026-08-04T01:16:00.255389Z","title":"Soft actor-critic for discrete action settings.arXiv preprint arXiv:1910.07207,","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2608.00133","last_updated":"2026-07-31T13:57:34Z","snapshot_observed_at":"2026-08-14T23:56:26.833488Z","submitted_at":"2026-07-31T13:57:34Z","title":"Deep Reinforcement Learning: From First Principles to Reasoning Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T01:16:00.255389Z"},"links":{"cited_paper":"/paper/1910.07207","citing_paper":"/paper/2608.00133"},"observation_digest":"sha256:13b54b7b0ed19a46cea2f124c302cf03c3a1828d14dae81abfbc5fd0157bba34","observation_id":"5d729623-6732-4a19-b31b-0a77d438c5f2","resolution":{"observed_at":"2026-08-04T01:16:00.255389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.07207","last_updated":"2019-10-18T09:17:44Z","snapshot_observed_at":"2026-08-14T00:35:36.804755Z","submitted_at":"2019-10-16T08:11:08Z","title":"Soft Actor-Critic for Discrete Action Settings","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.07207","snapshot_observed_at":"2026-08-11T11:20:20.061953Z","title":"Soft actor-critic for discrete action settings,","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2608.09762","last_updated":"2026-08-10T15:54:25Z","snapshot_observed_at":"2026-08-15T03:59:44.173644Z","submitted_at":"2026-08-10T15:54:25Z","title":"Efficient Real-World Online Reinforcement Learning for Robot Manipulation via Centralized Training and Critic Decomposition","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T11:20:20.061953Z"},"links":{"cited_paper":"/paper/1910.07207","citing_paper":"/paper/2608.09762"},"observation_digest":"sha256:7d877c8fdc8fe2d7d1189105784313e62f1de09d1de479b88ad9303e78a9facd","observation_id":"641735f2-9b57-48e6-98be-efa0f519e538","resolution":{"observed_at":"2026-08-11T11:20:20.061953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/1910.07207/citation-record","integrity":"/paper/1910.07207/integrity","json":"/paper/1910.07207/citation-record.json","paper":"/paper/1910.07207"},"outbound":[],"paper":{"arxiv_id":"1910.07207","last_updated":"2019-10-18T09:17:44Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-14T00:35:36.804755Z","submitted_at":"2019-10-16T08:11:08Z","title":"Soft Actor-Critic for Discrete Action Settings"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 30 inbound Pith citation observations for arXiv:1910.07207."}