{"as_of":"2026-08-10T16:44:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e4d225710c8efb261cd21f29687417e8ca26fe2bc87d59d35e9b2a431724938f","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":12,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":12,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":12,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":12,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T04:38:30.228255Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T04:17:36.943655Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2301.02328","last_updated":"2023-02-28T22:14:18Z","snapshot_observed_at":"2026-08-10T11:32:16.648791Z","submitted_at":"2023-01-05T23:14:38Z","title":"Extreme Q-Learning: MaxEnt RL without Entropy","version":2},"cited_work":{"arxiv_id":"2301.02328","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2301.02328","snapshot_observed_at":"2026-07-03T04:17:36.943655Z","title":"Extreme q-learning: Maxent rl without entropy","venue":null,"work_id":"e99ef3f5-ad9c-46de-ac20-b3ff28a87b76","year":2023},"citing_paper":{"arxiv_id":"2304.10573","last_updated":"2023-05-19T18:31:04Z","snapshot_observed_at":"2026-07-06T15:18:07.416392Z","submitted_at":"2023-04-20T18:04:09Z","title":"IDQL: Implicit Q-Learning as an Actor-Critic Method with Diffusion Policies","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-13T13:48:36.369334Z"},"links":{"cited_paper":"/paper/2301.02328","citing_paper":"/paper/2304.10573"},"observation_digest":"sha256:069248fa9722145c87f1681c4c8adc0a83d38ca5afa46782bebae8151245c114","observation_id":"575ff729-ed03-4652-b4e6-6f605c574e73","resolution":{"observed_at":"2026-05-13T13:48:36.476653Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02328","last_updated":"2023-02-28T22:14:18Z","snapshot_observed_at":"2026-08-10T11:32:16.648791Z","submitted_at":"2023-01-05T23:14:38Z","title":"Extreme Q-Learning: MaxEnt RL without Entropy","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02328","snapshot_observed_at":"2026-08-09T04:38:30.228255Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.03550","last_updated":"2025-02-05T19:08:42Z","snapshot_observed_at":"2026-08-10T12:46:07.609834Z","submitted_at":"2025-02-05T19:08:42Z","title":"TD-M(PC)$^2$: Improving Temporal Difference MPC Through Policy Constraint","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-09T04:38:30.228255Z"},"links":{"cited_paper":"/paper/2301.02328","citing_paper":"/paper/2502.03550"},"observation_digest":"sha256:7a57ca9e6e4e5de3bedf56b1511c568bc35000c312d7a4380351ec43cded2bc1","observation_id":"8b590690-0025-41e2-9905-07b1a5960926","resolution":{"observed_at":"2026-08-09T04:38:30.228255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02328","last_updated":"2023-02-28T22:14:18Z","snapshot_observed_at":"2026-08-10T11:32:16.648791Z","submitted_at":"2023-01-05T23:14:38Z","title":"Extreme Q-Learning: MaxEnt RL without Entropy","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02328","snapshot_observed_at":"2026-08-07T14:14:45.632354Z","title":"Extreme q-learning: Maxent rl without entropy.arXiv preprint arXiv:2301.02328,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19923","last_updated":"2025-05-26T12:45:54Z","snapshot_observed_at":"2026-08-09T00:05:32.443932Z","submitted_at":"2025-05-26T12:45:54Z","title":"Learning to Trust Bellman Updates: Selective State-Adaptive Regularization for Offline RL","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:45.632354Z"},"links":{"cited_paper":"/paper/2301.02328","citing_paper":"/paper/2505.19923"},"observation_digest":"sha256:11fce1bd2f8f5a1aca847f37218fd9212fb8ec513a2a6b5cd7f9f706fdcd7c73","observation_id":"202fe6ac-af03-4756-8236-36e4ef3b38c3","resolution":{"observed_at":"2026-08-07T14:14:45.632354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02328","last_updated":"2023-02-28T22:14:18Z","snapshot_observed_at":"2026-08-10T11:32:16.648791Z","submitted_at":"2023-01-05T23:14:38Z","title":"Extreme Q-Learning: MaxEnt RL without Entropy","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02328","snapshot_observed_at":"2026-08-07T05:22:24.560434Z","title":"Extreme q-learning: Maxent rl without entropy","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08417","last_updated":"2025-06-10T03:43:22Z","snapshot_observed_at":"2026-08-09T00:05:32.939577Z","submitted_at":"2025-06-10T03:43:22Z","title":"Offline RL with Smooth OOD Generalization in Convex Hull and its Neighborhood","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T05:22:24.560434Z"},"links":{"cited_paper":"/paper/2301.02328","citing_paper":"/paper/2506.08417"},"observation_digest":"sha256:2fcbfa51d9d28df3c208a33b133e98630c73f8e981bbc845d32f3ea4178b0426","observation_id":"14dd046c-95d9-4c78-9362-9a3b7e400315","resolution":{"observed_at":"2026-08-07T05:22:24.560434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02328","last_updated":"2023-02-28T22:14:18Z","snapshot_observed_at":"2026-08-10T11:32:16.648791Z","submitted_at":"2023-01-05T23:14:38Z","title":"Extreme Q-Learning: MaxEnt RL without Entropy","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02328","snapshot_observed_at":"2026-08-07T04:27:30.548506Z","title":"Extreme q-learning: Maxent rl without entropy,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12095","last_updated":"2025-06-12T11:39:21Z","snapshot_observed_at":"2026-08-09T00:05:01.559769Z","submitted_at":"2025-06-12T11:39:21Z","title":"DoublyAware: Dual Planning and Policy Awareness for Temporal Difference Learning in Humanoid Locomotion","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T04:27:30.548506Z"},"links":{"cited_paper":"/paper/2301.02328","citing_paper":"/paper/2506.12095"},"observation_digest":"sha256:5d7e79e8589cc49b5f888b07096b446225533149adcfc59cd17cb27ecd6fcf9e","observation_id":"6b556c63-0a75-4c9d-a391-14da58e48501","resolution":{"observed_at":"2026-08-07T04:27:30.548506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02328","last_updated":"2023-02-28T22:14:18Z","snapshot_observed_at":"2026-08-10T11:32:16.648791Z","submitted_at":"2023-01-05T23:14:38Z","title":"Extreme Q-Learning: MaxEnt RL without Entropy","version":2},"cited_work":{"arxiv_id":"2301.02328","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2301.02328","snapshot_observed_at":"2026-07-03T04:17:36.943655Z","title":"Extreme q-learning: Maxent rl without entropy","venue":null,"work_id":"e99ef3f5-ad9c-46de-ac20-b3ff28a87b76","year":2023},"citing_paper":{"arxiv_id":"2604.17919","last_updated":"2026-05-05T15:00:45Z","snapshot_observed_at":"2026-07-06T23:04:55.190916Z","submitted_at":"2026-04-20T07:54:36Z","title":"Fisher Decorator: Refining Flow Policy via a Local Transport Map","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-10T05:28:12.298066Z"},"links":{"cited_paper":"/paper/2301.02328","citing_paper":"/paper/2604.17919"},"observation_digest":"sha256:dd2da74c283e4e8f95bcb05e8f679a61afdffcc3418b2feffc7cac5457f2f291","observation_id":"09ecb643-05b9-49bf-94ae-8708d9a5997a","resolution":{"observed_at":"2026-05-10T06:51:46.587307Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02328","last_updated":"2023-02-28T22:14:18Z","snapshot_observed_at":"2026-08-10T11:32:16.648791Z","submitted_at":"2023-01-05T23:14:38Z","title":"Extreme Q-Learning: MaxEnt RL without Entropy","version":2},"cited_work":{"arxiv_id":"2301.02328","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2301.02328","snapshot_observed_at":"2026-07-03T04:17:36.943655Z","title":"Extreme q-learning: Maxent rl without entropy","venue":null,"work_id":"e99ef3f5-ad9c-46de-ac20-b3ff28a87b76","year":2023},"citing_paper":{"arxiv_id":"2605.01663","last_updated":"2026-05-28T02:21:27Z","snapshot_observed_at":"2026-07-06T23:14:52.417213Z","submitted_at":"2026-05-03T01:32:11Z","title":"Towards Efficient and Expressive Offline RL via Flow-Anchored Noise-conditioned Q-Learning","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-05-10T16:25:25.739019Z"},"links":{"cited_paper":"/paper/2301.02328","citing_paper":"/paper/2605.01663"},"observation_digest":"sha256:0dd7ef1d05207a8c5811554939644bf8365cb5d5b19864fb8de2204f3ea47f4b","observation_id":"d11e5360-8f6a-457d-9fe9-64a546f422c7","resolution":{"observed_at":"2026-05-11T08:56:00.657389Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02328","last_updated":"2023-02-28T22:14:18Z","snapshot_observed_at":"2026-08-10T11:32:16.648791Z","submitted_at":"2023-01-05T23:14:38Z","title":"Extreme Q-Learning: MaxEnt RL without Entropy","version":2},"cited_work":{"arxiv_id":"2301.02328","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2301.02328","snapshot_observed_at":"2026-07-03T04:17:36.943655Z","title":"Extreme q-learning: Maxent rl without entropy","venue":null,"work_id":"e99ef3f5-ad9c-46de-ac20-b3ff28a87b76","year":2023},"citing_paper":{"arxiv_id":"2605.06104","last_updated":"2026-05-07T12:20:25Z","snapshot_observed_at":"2026-08-05T12:13:27.618448Z","submitted_at":"2026-05-07T12:20:25Z","title":"Beyond Autoregressive RTG: Conditioning via Injection Outside Sequential Modeling in Decision Transformer","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-08T13:56:01.365382Z"},"links":{"cited_paper":"/paper/2301.02328","citing_paper":"/paper/2605.06104"},"observation_digest":"sha256:f82be5a880b7176eaefa3a659dd152a9dbcf671d67bafb6e404a483af5584fce","observation_id":"bf7a61dd-b81f-4142-a925-aa35fc35e55f","resolution":{"observed_at":"2026-05-11T18:46:10.148459Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02328","last_updated":"2023-02-28T22:14:18Z","snapshot_observed_at":"2026-08-10T11:32:16.648791Z","submitted_at":"2023-01-05T23:14:38Z","title":"Extreme Q-Learning: MaxEnt RL without Entropy","version":2},"cited_work":{"arxiv_id":"2301.02328","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2301.02328","snapshot_observed_at":"2026-07-03T04:17:36.943655Z","title":"Extreme q-learning: Maxent rl without entropy","venue":null,"work_id":"e99ef3f5-ad9c-46de-ac20-b3ff28a87b76","year":2023},"citing_paper":{"arxiv_id":"2605.14779","last_updated":"2026-05-14T12:48:44Z","snapshot_observed_at":"2026-07-06T23:26:09.066863Z","submitted_at":"2026-05-14T12:48:44Z","title":"Peng's Q($\\lambda$) for Conservative Value Estimation in Offline Reinforcement Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-30T21:45:43.298829Z"},"links":{"cited_paper":"/paper/2301.02328","citing_paper":"/paper/2605.14779"},"observation_digest":"sha256:6200b41d8fbeac6c2d8d0063baefec5337fdfa01e630cec101d32bfa069a05f7","observation_id":"3d758c3f-83aa-4a98-86e0-7347ec0464ca","resolution":{"observed_at":"2026-07-01T14:25:45.853436Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02328","last_updated":"2023-02-28T22:14:18Z","snapshot_observed_at":"2026-08-10T11:32:16.648791Z","submitted_at":"2023-01-05T23:14:38Z","title":"Extreme Q-Learning: MaxEnt RL without Entropy","version":2},"cited_work":{"arxiv_id":"2301.02328","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2301.02328","snapshot_observed_at":"2026-07-03T04:17:36.943655Z","title":"Extreme q-learning: Maxent rl without entropy","venue":null,"work_id":"e99ef3f5-ad9c-46de-ac20-b3ff28a87b76","year":2023},"citing_paper":{"arxiv_id":"2605.20408","last_updated":"2026-05-19T19:04:47Z","snapshot_observed_at":"2026-07-06T23:30:58.549353Z","submitted_at":"2026-05-19T19:04:47Z","title":"Spectral Souping: A Unified Framework for Online Preference Alignment","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-21T07:54:56.356555Z"},"links":{"cited_paper":"/paper/2301.02328","citing_paper":"/paper/2605.20408"},"observation_digest":"sha256:2d8cdffc2b685e4d48f965b254051598280d92c3d78073e7d2f9b9d73b4bc1a4","observation_id":"0729d11e-2144-4596-9322-bf9bc9c14bbb","resolution":{"observed_at":"2026-05-21T07:59:50.924661Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02328","last_updated":"2023-02-28T22:14:18Z","snapshot_observed_at":"2026-08-10T11:32:16.648791Z","submitted_at":"2023-01-05T23:14:38Z","title":"Extreme Q-Learning: MaxEnt RL without Entropy","version":2},"cited_work":{"arxiv_id":"2301.02328","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2301.02328","snapshot_observed_at":"2026-07-03T04:17:36.943655Z","title":"Extreme q-learning: Maxent rl without entropy","venue":null,"work_id":"e99ef3f5-ad9c-46de-ac20-b3ff28a87b76","year":2023},"citing_paper":{"arxiv_id":"2606.11087","last_updated":"2026-06-09T16:45:57Z","snapshot_observed_at":"2026-08-02T20:45:09.177143Z","submitted_at":"2026-06-09T16:45:57Z","title":"Test-Time Gradient Guidance of Flow Policies in Reinforcement Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-27T14:05:01.073951Z"},"links":{"cited_paper":"/paper/2301.02328","citing_paper":"/paper/2606.11087"},"observation_digest":"sha256:ff66ec4964d773c79de6a1588f6009c5a5143a625039da4f87d50c4bae461313","observation_id":"e8b078c2-2a53-450e-8180-6e537c3574f3","resolution":{"observed_at":"2026-07-03T04:17:36.945140Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02328","last_updated":"2023-02-28T22:14:18Z","snapshot_observed_at":"2026-08-10T11:32:16.648791Z","submitted_at":"2023-01-05T23:14:38Z","title":"Extreme Q-Learning: MaxEnt RL without Entropy","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02328","snapshot_observed_at":"2026-08-01T17:45:22.550304Z","title":"arXiv preprint arXiv:2301.02328 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17560","last_updated":"2026-07-20T05:09:36Z","snapshot_observed_at":"2026-08-05T13:38:45.921055Z","submitted_at":"2026-07-20T05:09:36Z","title":"Reinforcement Learning: From Algorithms To Foundation Models","version":1},"reference_index":269,"source":"arxiv_source","source_observed_at":"2026-08-01T17:45:22.550304Z"},"links":{"cited_paper":"/paper/2301.02328","citing_paper":"/paper/2607.17560"},"observation_digest":"sha256:20d08cc7cceb88a76006cfcc3eefcbab0c29255a104ebcf103e62ed03e64667a","observation_id":"b8ac3f31-467e-42f2-b8c9-b082063529b4","resolution":{"observed_at":"2026-08-01T17:45:22.550304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2301.02328/citation-record","integrity":"/paper/2301.02328/integrity","json":"/paper/2301.02328/citation-record.json","paper":"/paper/2301.02328"},"outbound":[],"paper":{"arxiv_id":"2301.02328","last_updated":"2023-02-28T22:14:18Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-10T11:32:16.648791Z","submitted_at":"2023-01-05T23:14:38Z","title":"Extreme Q-Learning: MaxEnt RL without Entropy"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 12 inbound Pith citation observations for arXiv:2301.02328."}