{"as_of":"2026-08-13T17:08:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c57afe261dd68b1918a950da6cd667f56b6b953e7cc204f81f32379c05b7a76d","coverage":[{"denominator":40,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T04:27:30.592023Z","state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.12095/citation-record","integrity":"/paper/2506.12095/integrity","json":"/paper/2506.12095/citation-record.json","paper":"/paper/2506.12095"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:27:32.191058Z","title":"Learning humanoid locomotion with transformers,","venue":null,"work_id":"d7c99b14-8062-4574-843e-fd92ad397b4d","year":2023},"citing_paper":{"arxiv_id":"2506.12095","last_updated":"2025-06-12T11:39:21Z","snapshot_observed_at":"2026-08-10T22:03:52.988861Z","submitted_at":"2025-06-12T11:39:21Z","title":"DoublyAware: Dual Planning and Policy Awareness for Temporal Difference Learning in Humanoid Locomotion","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T04:27:29.499106Z"},"links":{"citing_paper":"/paper/2506.12095"},"observation_digest":"sha256:54106184d6f94fb6809fd4e7b092f493e2c128fdbfa75f761cdacf93b69b5b61","observation_id":"e260941e-9d6f-4510-b2ae-7ccda0e66247","resolution":{"observed_at":"2026-08-07T04:27:32.278036Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:27:32.038870Z","title":"Real-world humanoid locomotion with reinforcement learning,","venue":null,"work_id":"04f18176-5d42-4b68-bbc4-b622ac0791ea","year":2024},"citing_paper":{"arxiv_id":"2506.12095","last_updated":"2025-06-12T11:39:21Z","snapshot_observed_at":"2026-08-10T22:03:52.988861Z","submitted_at":"2025-06-12T11:39:21Z","title":"DoublyAware: Dual Planning and Policy Awareness for Temporal Difference Learning in Humanoid Locomotion","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T04:27:29.537410Z"},"links":{"citing_paper":"/paper/2506.12095"},"observation_digest":"sha256:b9e9ad61c3eb0f41ce25a474a1c13ca4ea16cdb9dfbbaf56236af2ce1821405c","observation_id":"d7889185-0ee8-4d79-918b-ee4f71d97b26","resolution":{"observed_at":"2026-08-07T04:27:32.115658Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:27:31.827785Z","title":"Model predictive control,","venue":null,"work_id":"336eb4b6-c696-4564-b0ec-fee8b88e4f87","year":2016},"citing_paper":{"arxiv_id":"2506.12095","last_updated":"2025-06-12T11:39:21Z","snapshot_observed_at":"2026-08-10T22:03:52.988861Z","submitted_at":"2025-06-12T11:39:21Z","title":"DoublyAware: Dual Planning and Policy Awareness for Temporal Difference Learning in Humanoid Locomotion","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T04:27:29.589024Z"},"links":{"citing_paper":"/paper/2506.12095"},"observation_digest":"sha256:08e105755e2bfe788ed1ffec747e2202a9bc6b5f4649b5182921f1e0639028d4","observation_id":"52a8d7ac-5b49-41e5-8d74-14e8d27525b2","resolution":{"observed_at":"2026-08-07T04:27:31.932501Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:27:31.593877Z","title":"Aleatoric and epistemic uncertainty with random forests,","venue":null,"work_id":"453011fa-a0a5-4a0c-bbda-f3f69517ef8e","year":2020},"citing_paper":{"arxiv_id":"2506.12095","last_updated":"2025-06-12T11:39:21Z","snapshot_observed_at":"2026-08-10T22:03:52.988861Z","submitted_at":"2025-06-12T11:39:21Z","title":"DoublyAware: Dual Planning and Policy Awareness for Temporal Difference Learning in Humanoid Locomotion","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T04:27:29.628274Z"},"links":{"citing_paper":"/paper/2506.12095"},"observation_digest":"sha256:e43f686e77e2c5acdd4524ac0cb2fb5231b4ef52b8eaeba1b285cf279b8391b6","observation_id":"f4bab07a-8f8e-4064-9cf6-977f1283d99c","resolution":{"observed_at":"2026-08-07T04:27:31.656935Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:27:29.696736Z","title":"Aleatoric and epistemic uncertainty in machine learning: An introduction to concepts and methods,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.12095","last_updated":"2025-06-12T11:39:21Z","snapshot_observed_at":"2026-08-10T22:03:52.988861Z","submitted_at":"2025-06-12T11:39:21Z","title":"DoublyAware: Dual Planning and Policy Awareness for Temporal Difference Learning in Humanoid Locomotion","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T04:27:29.696736Z"},"links":{"citing_paper":"/paper/2506.12095"},"observation_digest":"sha256:2dc73c3630b1a0ab1a2de84fc5be836c2cd1b069a53c5de9ac86d66cf5ee5957","observation_id":"87224d6d-60e6-4b83-a8dd-19afe8e017c6","resolution":{"observed_at":"2026-08-07T04:27:29.696736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01628","last_updated":"2025-02-28T16:28:50Z","snapshot_observed_at":"2026-08-12T22:32:27.654845Z","submitted_at":"2024-10-02T15:02:32Z","title":"Stochasticity in Motion: An Information-Theoretic Approach to Trajectory Prediction","version":3},"cited_work":{"arxiv_id":"2410.01628","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.01628","snapshot_observed_at":"2026-08-07T04:27:30.953188Z","title":"Stochasticity in Motion: An Information-Theoretic Approach to Trajectory Prediction","venue":"cs.RO","work_id":"2a8f0f5c-c902-414f-bb72-93301b787dd7","year":2024},"citing_paper":{"arxiv_id":"2506.12095","last_updated":"2025-06-12T11:39:21Z","snapshot_observed_at":"2026-08-10T22:03:52.988861Z","submitted_at":"2025-06-12T11:39:21Z","title":"DoublyAware: Dual Planning and Policy Awareness for Temporal Difference Learning in Humanoid Locomotion","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T04:27:29.748895Z"},"links":{"cited_paper":"/paper/2410.01628","citing_paper":"/paper/2506.12095"},"observation_digest":"sha256:40a470255198eddef9e7b3c2b5176e2fbe6ca59262327e5582a7b9d8a1356290","observation_id":"4d584cc8-db7c-4a6e-81f4-d036127ff71f","resolution":{"observed_at":"2026-08-07T04:27:30.960812Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13785","last_updated":"2025-04-18T16:35:12Z","snapshot_observed_at":"2026-08-09T00:05:28.053835Z","submitted_at":"2025-04-18T16:35:12Z","title":"Learning Through Retrospection: Improving Trajectory Prediction for Automated Driving with Error Feedback","version":1},"cited_work":{"arxiv_id":"2504.13785","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.13785","snapshot_observed_at":"2026-08-07T04:27:30.898741Z","title":"Learning Through Retrospection: Improving Trajectory Prediction for Automated Driving with Error Feedback","venue":"cs.RO","work_id":"5d02e8d6-a151-47e4-a1fc-183d636af024","year":2025},"citing_paper":{"arxiv_id":"2506.12095","last_updated":"2025-06-12T11:39:21Z","snapshot_observed_at":"2026-08-10T22:03:52.988861Z","submitted_at":"2025-06-12T11:39:21Z","title":"DoublyAware: Dual Planning and Policy Awareness for Temporal Difference Learning in Humanoid Locomotion","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T04:27:29.806038Z"},"links":{"cited_paper":"/paper/2504.13785","citing_paper":"/paper/2506.12095"},"observation_digest":"sha256:a8c42006017ff8dcb9ba3ff7318874406560340caa6794f1cc7713068f8d96ad","observation_id":"8b5c315c-d480-435d-84ac-a50798c6409d","resolution":{"observed_at":"2026-08-07T04:27:30.909236Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:27:29.890578Z","title":"Temporal difference learning for model predictive control,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.12095","last_updated":"2025-06-12T11:39:21Z","snapshot_observed_at":"2026-08-10T22:03:52.988861Z","submitted_at":"2025-06-12T11:39:21Z","title":"DoublyAware: Dual Planning and Policy Awareness for Temporal Difference Learning in Humanoid Locomotion","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T04:27:29.890578Z"},"links":{"citing_paper":"/paper/2506.12095"},"observation_digest":"sha256:411b56d680e860ce4e6679477e9ea450918fabb6eb016e8324dae7ef753d1f52","observation_id":"878a5feb-84b3-4579-beea-fa4067b7500c","resolution":{"observed_at":"2026-08-07T04:27:29.890578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:27:31.517166Z","title":"Td-mpc2: Scalable, robust world models for continuous control,","venue":null,"work_id":"eec727b5-1e9f-45c0-b624-850eabef46bc","year":null},"citing_paper":{"arxiv_id":"2506.12095","last_updated":"2025-06-12T11:39:21Z","snapshot_observed_at":"2026-08-10T22:03:52.988861Z","submitted_at":"2025-06-12T11:39:21Z","title":"DoublyAware: Dual Planning and Policy Awareness for Temporal Difference Learning in Humanoid Locomotion","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T04:27:29.976944Z"},"links":{"citing_paper":"/paper/2506.12095"},"observation_digest":"sha256:ed9200f0cf44454ed9a1affc30084bfb4211d117b9b86b5d88c07c557c162f46","observation_id":"0e2d9b79-dbe9-4b1f-9065-b6a28d55aaa9","resolution":{"observed_at":"2026-08-07T04:27:31.541850Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:27:31.465839Z","title":"Deep reinforce- ment learning in a handful of trials using probabilistic dynamics models,","venue":null,"work_id":"fb30ae8a-c231-48b1-97f9-1d77eb81f962","year":2018},"citing_paper":{"arxiv_id":"2506.12095","last_updated":"2025-06-12T11:39:21Z","snapshot_observed_at":"2026-08-10T22:03:52.988861Z","submitted_at":"2025-06-12T11:39:21Z","title":"DoublyAware: Dual Planning and Policy Awareness for Temporal Difference Learning in Humanoid Locomotion","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T04:27:30.035313Z"},"links":{"citing_paper":"/paper/2506.12095"},"observation_digest":"sha256:8c64ae9c3d74b7d95591d61151321d9be900bfc0fab5f1f07228a210b36e8af6","observation_id":"56bbb6f7-6191-4408-94d9-414ebade58b5","resolution":{"observed_at":"2026-08-07T04:27:31.489789Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2008.05556","last_updated":"2021-03-17T17:22:51Z","snapshot_observed_at":"2026-08-01T17:10:08.501525Z","submitted_at":"2020-08-12T20:06:52Z","title":"Model-Based Offline Planning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2008.05556","snapshot_observed_at":"2026-08-07T04:27:30.087984Z","title":"Model-based offline planning,","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2506.12095","last_updated":"2025-06-12T11:39:21Z","snapshot_observed_at":"2026-08-10T22:03:52.988861Z","submitted_at":"2025-06-12T11:39:21Z","title":"DoublyAware: Dual Planning and Policy Awareness for Temporal Difference Learning in Humanoid Locomotion","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T04:27:30.087984Z"},"links":{"cited_paper":"/paper/2008.05556","citing_paper":"/paper/2506.12095"},"observation_digest":"sha256:a58fab1942288a0b136cf3eb24fbb7bc40e3f6077e0b7dec2a453111c596fea7","observation_id":"70dd384c-1d61-43f9-ac3f-887c72d72b08","resolution":{"observed_at":"2026-08-07T04:27:30.087984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03550","last_updated":"2025-02-05T19:08:42Z","snapshot_observed_at":"2026-08-13T13:39:05.762803Z","submitted_at":"2025-02-05T19:08:42Z","title":"TD-M(PC)$^2$: Improving Temporal Difference MPC Through Policy Constraint","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.03550","snapshot_observed_at":"2026-08-07T04:27:30.170831Z","title":"Improving td-mpc through policy constraint,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.12095","last_updated":"2025-06-12T11:39:21Z","snapshot_observed_at":"2026-08-10T22:03:52.988861Z","submitted_at":"2025-06-12T11:39:21Z","title":"DoublyAware: Dual Planning and Policy Awareness for Temporal Difference Learning in Humanoid Locomotion","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T04:27:30.170831Z"},"links":{"cited_paper":"/paper/2502.03550","citing_paper":"/paper/2506.12095"},"observation_digest":"sha256:f34ceb7129f2c6d2270c3f6178d91c2fde856020d1a61c109fa7331a678561bf","observation_id":"a772cadb-ca4b-44c8-844c-52e155ff9de9","resolution":{"observed_at":"2026-08-07T04:27:30.170831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:27:30.198273Z","title":"V ovk, A","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2506.12095","last_updated":"2025-06-12T11:39:21Z","snapshot_observed_at":"2026-08-10T22:03:52.988861Z","submitted_at":"2025-06-12T11:39:21Z","title":"DoublyAware: Dual Planning and Policy Awareness for Temporal Difference Learning in Humanoid Locomotion","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T04:27:30.198273Z"},"links":{"citing_paper":"/paper/2506.12095"},"observation_digest":"sha256:ca15bd73f390026992332769fb15e29c123f6fa67d37507c2f9a107ae54d023a","observation_id":"986fb49b-5f58-42ba-9610-d3c7d1488490","resolution":{"observed_at":"2026-08-07T04:27:30.198273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-07T04:27:30.305025Z","title":"Pushing the limits of mathematical reasoning in open language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12095","last_updated":"2025-06-12T11:39:21Z","snapshot_observed_at":"2026-08-10T22:03:52.988861Z","submitted_at":"2025-06-12T11:39:21Z","title":"DoublyAware: Dual Planning and Policy Awareness for Temporal Difference Learning in Humanoid Locomotion","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T04:27:30.305025Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2506.12095"},"observation_digest":"sha256:8973b7519ea4f8de2fe3321d4a1fd97b2aed43c8a473aed633a62a84713f7339","observation_id":"6cdcabf3-1b02-4939-94c8-9de1834b17a6","resolution":{"observed_at":"2026-08-07T04:27:30.305025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.10506","last_updated":"2024-06-18T18:11:07Z","snapshot_observed_at":"2026-08-13T00:53:11.671999Z","submitted_at":"2024-03-15T17:45:44Z","title":"HumanoidBench: Simulated Humanoid Benchmark for Whole-Body Locomotion and Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.10506","snapshot_observed_at":"2026-08-07T04:27:30.356457Z","title":"Humanoid- bench: Simulated humanoid benchmark for whole-body locomotion and manipulation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12095","last_updated":"2025-06-12T11:39:21Z","snapshot_observed_at":"2026-08-10T22:03:52.988861Z","submitted_at":"2025-06-12T11:39:21Z","title":"DoublyAware: Dual Planning and Policy Awareness for Temporal Difference Learning in Humanoid Locomotion","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T04:27:30.356457Z"},"links":{"cited_paper":"/paper/2403.10506","citing_paper":"/paper/2506.12095"},"observation_digest":"sha256:a52b810880bf8328f41e9782e2108010cf8c0909c56a797724bcece1d811b98b","observation_id":"8b14b05d-c8fa-4c20-b22a-d15cb39aa7d0","resolution":{"observed_at":"2026-08-07T04:27:30.356457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:27:31.397267Z","title":"Reinforcement learning for humanoid robotics,","venue":null,"work_id":"73d6477c-94cd-47c1-b18f-c37a3542bb01","year":2003},"citing_paper":{"arxiv_id":"2506.12095","last_updated":"2025-06-12T11:39:21Z","snapshot_observed_at":"2026-08-10T22:03:52.988861Z","submitted_at":"2025-06-12T11:39:21Z","title":"DoublyAware: Dual Planning and Policy Awareness for Temporal Difference Learning in Humanoid Locomotion","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T04:27:30.415385Z"},"links":{"citing_paper":"/paper/2506.12095"},"observation_digest":"sha256:dcbd397186daf6d704f3ec190b0a502706e54f891041bcb9a9c72cbe85564130","observation_id":"c337b9cf-f2b7-4f20-9d21-9d6a3f968b11","resolution":{"observed_at":"2026-08-07T04:27:31.425332Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:27:31.371859Z","title":"Learning off-policy with online planning,","venue":null,"work_id":"ab23a847-2970-414f-9b88-eb589dfe555c","year":2022},"citing_paper":{"arxiv_id":"2506.12095","last_updated":"2025-06-12T11:39:21Z","snapshot_observed_at":"2026-08-10T22:03:52.988861Z","submitted_at":"2025-06-12T11:39:21Z","title":"DoublyAware: Dual Planning and Policy Awareness for Temporal Difference Learning in Humanoid Locomotion","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T04:27:30.423302Z"},"links":{"citing_paper":"/paper/2506.12095"},"observation_digest":"sha256:dbc787e3ddd361c71f96f31a240b60c3570166a31c340b9d2e7b2606075271a8","observation_id":"11b382bb-3341-4f1c-90fb-c1db1f7a0b97","resolution":{"observed_at":"2026-08-07T04:27:31.380410Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:27:31.352262Z","title":"Conformal prediction in manifold learning,","venue":null,"work_id":"b54c9cb7-cdc1-4959-afaf-1fc4d012a5b5","year":2018},"citing_paper":{"arxiv_id":"2506.12095","last_updated":"2025-06-12T11:39:21Z","snapshot_observed_at":"2026-08-10T22:03:52.988861Z","submitted_at":"2025-06-12T11:39:21Z","title":"DoublyAware: Dual Planning and Policy Awareness for Temporal Difference Learning in Humanoid Locomotion","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T04:27:30.428872Z"},"links":{"citing_paper":"/paper/2506.12095"},"observation_digest":"sha256:d0fc279aedb0b7da85edab5681540474ed7bb7b10decce69bb528ff7527ddec2","observation_id":"f123cf6a-1eea-4d54-8c5a-9b4320964f46","resolution":{"observed_at":"2026-08-07T04:27:31.357234Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.17487","last_updated":"2024-04-26T15:43:06Z","snapshot_observed_at":"2026-08-13T00:20:46.580118Z","submitted_at":"2024-04-26T15:43:06Z","title":"Conformal Prediction with Learned Features","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.17487","snapshot_observed_at":"2026-08-07T04:27:30.435680Z","title":"Conformal prediction with learned features,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12095","last_updated":"2025-06-12T11:39:21Z","snapshot_observed_at":"2026-08-10T22:03:52.988861Z","submitted_at":"2025-06-12T11:39:21Z","title":"DoublyAware: Dual Planning and Policy Awareness for Temporal Difference Learning in Humanoid Locomotion","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T04:27:30.435680Z"},"links":{"cited_paper":"/paper/2404.17487","citing_paper":"/paper/2506.12095"},"observation_digest":"sha256:41eea600e3f6d968976725cad4738c369833d582389b75af4916b8005b74c43b","observation_id":"614f192f-7e1f-4661-83c0-acde746bf96c","resolution":{"observed_at":"2026-08-07T04:27:30.435680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:27:31.331496Z","title":"Confor- mal prediction for semantically-aware autonomous perception in urban environments,","venue":null,"work_id":"66538cef-ce91-402b-8b77-f5e791180c75","year":null},"citing_paper":{"arxiv_id":"2506.12095","last_updated":"2025-06-12T11:39:21Z","snapshot_observed_at":"2026-08-10T22:03:52.988861Z","submitted_at":"2025-06-12T11:39:21Z","title":"DoublyAware: Dual Planning and Policy Awareness for Temporal Difference Learning in Humanoid Locomotion","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T04:27:30.445140Z"},"links":{"citing_paper":"/paper/2506.12095"},"observation_digest":"sha256:1e0ef8ecca0b27909900b960b42076fddaa3b4e2ff361428cd87a51a8dfbebe6","observation_id":"2d667aa7-e41b-4da9-884c-c297c762fdd9","resolution":{"observed_at":"2026-08-07T04:27:31.338215Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:27:31.302620Z","title":"Conformal prediction for uncertainty-aware planning with diffusion dynamics model,","venue":null,"work_id":"86dcedac-c70e-4b5d-bc56-446bd4f931f8","year":2023},"citing_paper":{"arxiv_id":"2506.12095","last_updated":"2025-06-12T11:39:21Z","snapshot_observed_at":"2026-08-10T22:03:52.988861Z","submitted_at":"2025-06-12T11:39:21Z","title":"DoublyAware: Dual Planning and Policy Awareness for Temporal Difference Learning in Humanoid Locomotion","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T04:27:30.452592Z"},"links":{"citing_paper":"/paper/2506.12095"},"observation_digest":"sha256:1bf4c2b3fd50cf0fd4d64f4953147990eccfd35b1305fafe40083909578ffaac","observation_id":"c3a52c1e-a316-4937-83dc-e277ce094e56","resolution":{"observed_at":"2026-08-07T04:27:31.307658Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:27:31.279946Z","title":"Adaptive conformal prediction for motion planning among dynamic agents,","venue":null,"work_id":"7e772bbf-b34e-43c8-a47d-e809770d03f6","year":2023},"citing_paper":{"arxiv_id":"2506.12095","last_updated":"2025-06-12T11:39:21Z","snapshot_observed_at":"2026-08-10T22:03:52.988861Z","submitted_at":"2025-06-12T11:39:21Z","title":"DoublyAware: Dual Planning and Policy Awareness for Temporal Difference Learning in Humanoid Locomotion","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T04:27:30.459658Z"},"links":{"citing_paper":"/paper/2506.12095"},"observation_digest":"sha256:ff0e949ce091d29c4777879df2b6a705a60a15cdb34afaa3d6bb91fd225fb7e7","observation_id":"07eba7e6-feff-4612-8708-cba7edc3e584","resolution":{"observed_at":"2026-08-07T04:27:31.286345Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:27:31.258672Z","title":"Safe planning in dynamic environments using conformal prediction,","venue":null,"work_id":"d2490db1-3afa-4f75-be65-0b6f00c4c95c","year":2023},"citing_paper":{"arxiv_id":"2506.12095","last_updated":"2025-06-12T11:39:21Z","snapshot_observed_at":"2026-08-10T22:03:52.988861Z","submitted_at":"2025-06-12T11:39:21Z","title":"DoublyAware: Dual Planning and Policy Awareness for Temporal Difference Learning in Humanoid Locomotion","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T04:27:30.467615Z"},"links":{"citing_paper":"/paper/2506.12095"},"observation_digest":"sha256:bc9d2f7403bc9d8506070384b60097ac48486b262542984db5f8c2a65dad274b","observation_id":"82632f0d-106c-4c04-aac0-bbe697569ced","resolution":{"observed_at":"2026-08-07T04:27:31.267133Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:27:31.240509Z","title":"Safe perception-based control under stochastic sensor uncertainty using con- formal prediction,","venue":null,"work_id":"440b4473-db0d-4a5a-8e68-c5dd48d20cb8","year":2023},"citing_paper":{"arxiv_id":"2506.12095","last_updated":"2025-06-12T11:39:21Z","snapshot_observed_at":"2026-08-10T22:03:52.988861Z","submitted_at":"2025-06-12T11:39:21Z","title":"DoublyAware: Dual Planning and Policy Awareness for Temporal Difference Learning in Humanoid Locomotion","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T04:27:30.473135Z"},"links":{"citing_paper":"/paper/2506.12095"},"observation_digest":"sha256:e0639d2f2d82758df1240d6d91cb55dcf05515fa6ec647065ccff83e22556876","observation_id":"6f144c20-bd22-4315-af55-7676327a4b1d","resolution":{"observed_at":"2026-08-07T04:27:31.246167Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:27:31.223805Z","title":"Conformal decision theory: Safe autonomous decisions from imperfect predictions,","venue":null,"work_id":"334b70e0-6bd6-4f56-818a-fa9cf5c58ee9","year":2024},"citing_paper":{"arxiv_id":"2506.12095","last_updated":"2025-06-12T11:39:21Z","snapshot_observed_at":"2026-08-10T22:03:52.988861Z","submitted_at":"2025-06-12T11:39:21Z","title":"DoublyAware: Dual Planning and Policy Awareness for Temporal Difference Learning in Humanoid Locomotion","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T04:27:30.480932Z"},"links":{"citing_paper":"/paper/2506.12095"},"observation_digest":"sha256:957451c523af527698363f7eb84df1e5f5baf9cf3a82442cddd8f31ba9fd6d73","observation_id":"94498e85-f25f-4691-9792-b54b2eee61c2","resolution":{"observed_at":"2026-08-07T04:27:31.229092Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:27:31.197118Z","title":"Safe pomdp online planning among dynamic agents via adaptive conformal prediction,","venue":null,"work_id":"acc5cb80-1bd9-44e8-95fb-b11ad22e7ebe","year":2024},"citing_paper":{"arxiv_id":"2506.12095","last_updated":"2025-06-12T11:39:21Z","snapshot_observed_at":"2026-08-10T22:03:52.988861Z","submitted_at":"2025-06-12T11:39:21Z","title":"DoublyAware: Dual Planning and Policy Awareness for Temporal Difference Learning in Humanoid Locomotion","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T04:27:30.486796Z"},"links":{"citing_paper":"/paper/2506.12095"},"observation_digest":"sha256:61a24d382772d9c2d36944d0e5d396964bca2aa6c9dc78caabc581312b678d16","observation_id":"668e69c2-056f-45a2-9bbf-c26ed3c50442","resolution":{"observed_at":"2026-08-07T04:27:31.206160Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:27:31.173972Z","title":"Conformal policy learning for sensorimotor control under distribution shifts,","venue":null,"work_id":"01681614-199c-4e14-910f-42c980c919df","year":2024},"citing_paper":{"arxiv_id":"2506.12095","last_updated":"2025-06-12T11:39:21Z","snapshot_observed_at":"2026-08-10T22:03:52.988861Z","submitted_at":"2025-06-12T11:39:21Z","title":"DoublyAware: Dual Planning and Policy Awareness for Temporal Difference Learning in Humanoid Locomotion","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T04:27:30.493848Z"},"links":{"citing_paper":"/paper/2506.12095"},"observation_digest":"sha256:17d4502648d48e1a233e44eb85b86d0775a940b6e4f06633975ec54e256d42a0","observation_id":"9982d18c-a52c-4002-948c-34f7c9562c1e","resolution":{"observed_at":"2026-08-07T04:27:31.180556Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07767","last_updated":"2024-07-10T18:34:05Z","snapshot_observed_at":"2026-08-12T23:45:05.151750Z","submitted_at":"2024-06-11T23:16:46Z","title":"Conformalized Teleoperation: Confidently Mapping Human Inputs to High-Dimensional Robot Actions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07767","snapshot_observed_at":"2026-08-07T04:27:30.502164Z","title":"Conformalized teleoperation: Confidently mapping human inputs to high-dimensional robot actions,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12095","last_updated":"2025-06-12T11:39:21Z","snapshot_observed_at":"2026-08-10T22:03:52.988861Z","submitted_at":"2025-06-12T11:39:21Z","title":"DoublyAware: Dual Planning and Policy Awareness for Temporal Difference Learning in Humanoid Locomotion","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T04:27:30.502164Z"},"links":{"cited_paper":"/paper/2406.07767","citing_paper":"/paper/2506.12095"},"observation_digest":"sha256:43135750d274426bf918b7be8ef6a7219dcb307491a2df10713c37c95779ae7e","observation_id":"45659071-8e67-416d-9c9d-f0cb3d6260ba","resolution":{"observed_at":"2026-08-07T04:27:30.502164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:27:31.149708Z","title":"Stabilizing off- policy q-learning via bootstrapping error reduction,","venue":null,"work_id":"cbb95ace-a845-434d-94f3-e6508db22260","year":2019},"citing_paper":{"arxiv_id":"2506.12095","last_updated":"2025-06-12T11:39:21Z","snapshot_observed_at":"2026-08-10T22:03:52.988861Z","submitted_at":"2025-06-12T11:39:21Z","title":"DoublyAware: Dual Planning and Policy Awareness for Temporal Difference Learning in Humanoid Locomotion","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T04:27:30.512999Z"},"links":{"citing_paper":"/paper/2506.12095"},"observation_digest":"sha256:2ad2e418ef32948e5725e2a7014ed69d212ae825302bc02c75ccb360d6fd636a","observation_id":"129a9df3-0ca0-4cd3-9f37-ab4523e42d85","resolution":{"observed_at":"2026-08-07T04:27:31.157675Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:27:31.125406Z","title":"Conservative q-learning for offline reinforcement learning,","venue":null,"work_id":"a5cdd8d8-2385-4ecd-a36d-589eeeb13d9c","year":2020},"citing_paper":{"arxiv_id":"2506.12095","last_updated":"2025-06-12T11:39:21Z","snapshot_observed_at":"2026-08-10T22:03:52.988861Z","submitted_at":"2025-06-12T11:39:21Z","title":"DoublyAware: Dual Planning and Policy Awareness for Temporal Difference Learning in Humanoid Locomotion","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T04:27:30.521022Z"},"links":{"citing_paper":"/paper/2506.12095"},"observation_digest":"sha256:c767ff0abeba2788971c4af8500b867376016274917be4ca12b8e196ed1d54ea","observation_id":"c8364e28-c826-42d7-b104-9488c5a1d8bd","resolution":{"observed_at":"2026-08-07T04:27:31.135640Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:27:31.096921Z","title":"A minimalist approach to offline reinforce- ment learning,","venue":null,"work_id":"0f05727a-1016-4c02-9b0b-d6f62e80df82","year":2021},"citing_paper":{"arxiv_id":"2506.12095","last_updated":"2025-06-12T11:39:21Z","snapshot_observed_at":"2026-08-10T22:03:52.988861Z","submitted_at":"2025-06-12T11:39:21Z","title":"DoublyAware: Dual Planning and Policy Awareness for Temporal Difference Learning in Humanoid Locomotion","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T04:27:30.527463Z"},"links":{"citing_paper":"/paper/2506.12095"},"observation_digest":"sha256:6d461242ec66362fdfabc2c5565730e4109fb17dd1466d362c88aa626188c0c3","observation_id":"03d3fb43-b9bb-442d-b1ed-df58065d65db","resolution":{"observed_at":"2026-08-07T04:27:31.103450Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:27:31.072851Z","title":"Off-policy deep reinforcement learning without exploration,","venue":null,"work_id":"f8e2b8bb-e70f-43b3-b86b-c784d688eba0","year":2019},"citing_paper":{"arxiv_id":"2506.12095","last_updated":"2025-06-12T11:39:21Z","snapshot_observed_at":"2026-08-10T22:03:52.988861Z","submitted_at":"2025-06-12T11:39:21Z","title":"DoublyAware: Dual Planning and Policy Awareness for Temporal Difference Learning in Humanoid Locomotion","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T04:27:30.533658Z"},"links":{"citing_paper":"/paper/2506.12095"},"observation_digest":"sha256:ce31f6bad4451e6ab319141f229933d17dcc04fa56896a056ca554ef7bf1dfaa","observation_id":"f0913dee-c670-42da-9b0f-7160d230e533","resolution":{"observed_at":"2026-08-07T04:27:31.079366Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.00177","last_updated":"2019-10-07T20:23:21Z","snapshot_observed_at":"2026-08-13T13:59:34.315271Z","submitted_at":"2019-10-01T02:23:38Z","title":"Advantage-Weighted Regression: Simple and Scalable Off-Policy Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.00177","snapshot_observed_at":"2026-08-07T04:27:30.542382Z","title":"Advantage-weighted regression: Simple and scalable off-policy reinforcement learning,","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2506.12095","last_updated":"2025-06-12T11:39:21Z","snapshot_observed_at":"2026-08-10T22:03:52.988861Z","submitted_at":"2025-06-12T11:39:21Z","title":"DoublyAware: Dual Planning and Policy Awareness for Temporal Difference Learning in Humanoid Locomotion","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T04:27:30.542382Z"},"links":{"cited_paper":"/paper/1910.00177","citing_paper":"/paper/2506.12095"},"observation_digest":"sha256:6876ba5ecefb3396c1837b6be8d5765171655a2c6d4cacd74904698115e75497","observation_id":"f69c47d4-639e-4bb8-a9b2-5ee79a991814","resolution":{"observed_at":"2026-08-07T04:27:30.542382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02328","last_updated":"2023-02-28T22:14:18Z","snapshot_observed_at":"2026-08-13T13:09:03.918851Z","submitted_at":"2023-01-05T23:14:38Z","title":"Extreme Q-Learning: MaxEnt RL without Entropy","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02328","snapshot_observed_at":"2026-08-07T04:27:30.548506Z","title":"Extreme q-learning: Maxent rl without entropy,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12095","last_updated":"2025-06-12T11:39:21Z","snapshot_observed_at":"2026-08-10T22:03:52.988861Z","submitted_at":"2025-06-12T11:39:21Z","title":"DoublyAware: Dual Planning and Policy Awareness for Temporal Difference Learning in Humanoid Locomotion","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T04:27:30.548506Z"},"links":{"cited_paper":"/paper/2301.02328","citing_paper":"/paper/2506.12095"},"observation_digest":"sha256:85eca9eb3528c50266fb205194f789768455ae5eb5cd4224065d82f07246b66e","observation_id":"6b556c63-0a75-4c9d-a391-14da58e48501","resolution":{"observed_at":"2026-08-07T04:27:30.548506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.06169","last_updated":"2021-10-12T17:05:05Z","snapshot_observed_at":"2026-08-13T07:57:56.087944Z","submitted_at":"2021-10-12T17:05:05Z","title":"Offline Reinforcement Learning with Implicit Q-Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.06169","snapshot_observed_at":"2026-08-07T04:27:30.555683Z","title":"Offline reinforcement learning with implicit q-learning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.12095","last_updated":"2025-06-12T11:39:21Z","snapshot_observed_at":"2026-08-10T22:03:52.988861Z","submitted_at":"2025-06-12T11:39:21Z","title":"DoublyAware: Dual Planning and Policy Awareness for Temporal Difference Learning in Humanoid Locomotion","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T04:27:30.555683Z"},"links":{"cited_paper":"/paper/2110.06169","citing_paper":"/paper/2506.12095"},"observation_digest":"sha256:a8e467e1a52111937f38775f4e1ba788a8c34944f92ecb57d7216b357906ead1","observation_id":"05760fd6-b9e7-4ee7-9971-fb4e4a86156d","resolution":{"observed_at":"2026-08-07T04:27:30.555683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:27:30.561578Z","title":"Aggressive driving with model predictive path integral control,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.12095","last_updated":"2025-06-12T11:39:21Z","snapshot_observed_at":"2026-08-10T22:03:52.988861Z","submitted_at":"2025-06-12T11:39:21Z","title":"DoublyAware: Dual Planning and Policy Awareness for Temporal Difference Learning in Humanoid Locomotion","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T04:27:30.561578Z"},"links":{"citing_paper":"/paper/2506.12095"},"observation_digest":"sha256:b8659022a5c79f067297d3e04e1649e4798765f72c2e1508da6c9828eede0413","observation_id":"d9f23434-f2ee-4508-8fb0-c5c7e8889472","resolution":{"observed_at":"2026-08-07T04:27:30.561578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:27:30.569861Z","title":"Trust region policy optimization,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.12095","last_updated":"2025-06-12T11:39:21Z","snapshot_observed_at":"2026-08-10T22:03:52.988861Z","submitted_at":"2025-06-12T11:39:21Z","title":"DoublyAware: Dual Planning and Policy Awareness for Temporal Difference Learning in Humanoid Locomotion","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T04:27:30.569861Z"},"links":{"citing_paper":"/paper/2506.12095"},"observation_digest":"sha256:1284b7cfab399a5bc84df8e2ae02c4c4aab2124c1c8fe22251ac7784f875a2bd","observation_id":"4e8df83b-7ac8-4750-ad88-c1415d4c9e99","resolution":{"observed_at":"2026-08-07T04:27:30.569861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:27:31.008412Z","title":"Soft actor-critic: Off- policy maximum entropy deep reinforcement learning with a stochastic actor,","venue":null,"work_id":"e382cffd-4cba-421e-a6cf-90b0dffeb58e","year":2018},"citing_paper":{"arxiv_id":"2506.12095","last_updated":"2025-06-12T11:39:21Z","snapshot_observed_at":"2026-08-10T22:03:52.988861Z","submitted_at":"2025-06-12T11:39:21Z","title":"DoublyAware: Dual Planning and Policy Awareness for Temporal Difference Learning in Humanoid Locomotion","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T04:27:30.576382Z"},"links":{"citing_paper":"/paper/2506.12095"},"observation_digest":"sha256:86192289e132f5f1bbfdcf9224b72592365d4fbc45a424a633ff8588e1397276","observation_id":"dc279f4d-39da-4c85-b56e-c235f4528584","resolution":{"observed_at":"2026-08-07T04:27:31.019435Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:27:30.585942Z","title":"Imitation is not enough: Ro- bustifying imitation with reinforcement learning for challenging driving scenarios,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12095","last_updated":"2025-06-12T11:39:21Z","snapshot_observed_at":"2026-08-10T22:03:52.988861Z","submitted_at":"2025-06-12T11:39:21Z","title":"DoublyAware: Dual Planning and Policy Awareness for Temporal Difference Learning in Humanoid Locomotion","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T04:27:30.585942Z"},"links":{"citing_paper":"/paper/2506.12095"},"observation_digest":"sha256:486f0bffbce09e56c37170864e50444b16944ed0539d65b5077f45b7d56bfc78","observation_id":"f335dd01-54b4-4e0e-88e6-d9ab13ca0f86","resolution":{"observed_at":"2026-08-07T04:27:30.585942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.09359","last_updated":"2021-04-24T22:39:30Z","snapshot_observed_at":"2026-07-06T09:29:45.475911Z","submitted_at":"2020-06-16T17:54:41Z","title":"AWAC: Accelerating Online Reinforcement Learning with Offline Datasets","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.09359","snapshot_observed_at":"2026-08-07T04:27:30.592023Z","title":"Awac: Accelerating online reinforcement learning with offline datasets,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2506.12095","last_updated":"2025-06-12T11:39:21Z","snapshot_observed_at":"2026-08-10T22:03:52.988861Z","submitted_at":"2025-06-12T11:39:21Z","title":"DoublyAware: Dual Planning and Policy Awareness for Temporal Difference Learning in Humanoid Locomotion","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T04:27:30.592023Z"},"links":{"cited_paper":"/paper/2006.09359","citing_paper":"/paper/2506.12095"},"observation_digest":"sha256:9a17e90293d5e7db375a3e2313772f676757021bce49aaa6e3fc111483dcbc0c","observation_id":"4a59ac21-e20c-4335-982e-fa8a68de9b1a","resolution":{"observed_at":"2026-08-07T04:27:30.592023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.12095","last_updated":"2025-06-12T11:39:21Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-10T22:03:52.988861Z","submitted_at":"2025-06-12T11:39:21Z","title":"DoublyAware: Dual Planning and Policy Awareness for Temporal Difference Learning in Humanoid Locomotion"},"reference_resolution":{"displayed":40,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":16,"verified_exact":2,"verified_fuzzy":22},"total_outbound_references":40},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 40 of 40 outbound references and 0 inbound Pith citation observations for arXiv:2506.12095."}