{"as_of":"2026-08-17T15:45:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5406ab7f9f48151e5d3243e61e8b995c43bd54ede970e459b26fcdab3f44317c","coverage":[{"denominator":64,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":64,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T17:03:21.467027Z","state":"measured"},{"denominator":65,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":65,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-29T04:18:02.341742Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-01T17:05:50.616851Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.17230","last_updated":"2025-09-06T14:24:21Z","snapshot_observed_at":"2026-08-14T16:39:29.021901Z","submitted_at":"2025-08-24T07:06:56Z","title":"4D Visual Pre-training for Robot Learning","version":2},"cited_work":{"arxiv_id":"2508.17230","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.17230","snapshot_observed_at":"2026-07-01T17:05:50.616851Z","title":null,"venue":null,"work_id":"8c14de08-f2b6-4b92-922a-13bf51271878","year":2025},"citing_paper":{"arxiv_id":"2606.28215","last_updated":"2026-06-26T16:05:58Z","snapshot_observed_at":"2026-08-07T08:50:21.361337Z","submitted_at":"2026-06-26T16:05:58Z","title":"HAT-4D: Lifting Monocular Video for 4D Multi-Object Interactions via Human-Agent Collaboration","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-29T04:18:02.341742Z"},"links":{"cited_paper":"/paper/2508.17230","citing_paper":"/paper/2606.28215"},"observation_digest":"sha256:82f455eba3e3532a0bda9449133d4a951cca7b48948c5cd19bbb4e466dbb1dbd","observation_id":"5a7e9431-ae2c-4ab2-8f13-ae8a4b1ad604","resolution":{"observed_at":"2026-07-01T17:05:50.618485Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2508.17230/citation-record","integrity":"/paper/2508.17230/integrity","json":"/paper/2508.17230/citation-record.json","paper":"/paper/2508.17230"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2105.14257","last_updated":"2024-11-04T03:01:27Z","snapshot_observed_at":"2026-08-16T18:21:15.956072Z","submitted_at":"2021-05-29T09:26:02Z","title":"Diffusion-Based Representation Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.14257","snapshot_observed_at":"2026-08-05T17:03:21.017683Z","title":"Diffusion-based representa- tion learning.arXiv preprint arXiv:2105.14257, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.17230","last_updated":"2025-09-06T14:24:21Z","snapshot_observed_at":"2026-08-14T16:39:29.021901Z","submitted_at":"2025-08-24T07:06:56Z","title":"4D Visual Pre-training for Robot Learning","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T17:03:21.017683Z"},"links":{"cited_paper":"/paper/2105.14257","citing_paper":"/paper/2508.17230"},"observation_digest":"sha256:950d6a3d7d34463248675c661002cf0dbdc82e08d9db3590ae195c29ca99a386","observation_id":"6a635510-11fe-4aeb-9a56-f8e3070eb9b9","resolution":{"observed_at":"2026-08-05T17:03:21.017683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:03:22.333829Z","title":"Cobot magic: An open-source robotic system.https://global.agilex.ai/products/ cobot-magic, 2025","venue":null,"work_id":"e0fde486-f578-4ec9-ac5d-3614addd71b4","year":2025},"citing_paper":{"arxiv_id":"2508.17230","last_updated":"2025-09-06T14:24:21Z","snapshot_observed_at":"2026-08-14T16:39:29.021901Z","submitted_at":"2025-08-24T07:06:56Z","title":"4D Visual Pre-training for Robot Learning","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T17:03:21.139352Z"},"links":{"citing_paper":"/paper/2508.17230"},"observation_digest":"sha256:72aa3aca42c508b38124b207303b18b1a527b2a9aec670f15b083b029d731e56","observation_id":"966afc96-74aa-45a7-8078-86a83e867bc3","resolution":{"observed_at":"2026-08-05T17:03:22.338006Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:03:22.320397Z","title":"Is conditional gen- erative modeling all you need for decision-making?, 2023","venue":null,"work_id":"94f2341b-7c7d-4bf9-99bf-71db0fc91dd0","year":2023},"citing_paper":{"arxiv_id":"2508.17230","last_updated":"2025-09-06T14:24:21Z","snapshot_observed_at":"2026-08-14T16:39:29.021901Z","submitted_at":"2025-08-24T07:06:56Z","title":"4D Visual Pre-training for Robot Learning","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T17:03:21.225443Z"},"links":{"citing_paper":"/paper/2508.17230"},"observation_digest":"sha256:caec8c8a7a8828c44424cd4dcea1b1315e0781ae4aa8ac9b0d536cbdc2538eaa","observation_id":"eb778560-faca-4d28-99e0-00c7c75dabbd","resolution":{"observed_at":"2026-08-05T17:03:22.324751Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04137","last_updated":"2024-03-14T04:36:31Z","snapshot_observed_at":"2026-08-08T17:26:38.829859Z","submitted_at":"2023-03-07T18:50:03Z","title":"Diffusion Policy: Visuomotor Policy Learning via Action Diffusion","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.04137","snapshot_observed_at":"2026-08-05T17:03:21.230022Z","title":"Diffu- sion policy: Visuomotor policy learning via action diffusion","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.17230","last_updated":"2025-09-06T14:24:21Z","snapshot_observed_at":"2026-08-14T16:39:29.021901Z","submitted_at":"2025-08-24T07:06:56Z","title":"4D Visual Pre-training for Robot Learning","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T17:03:21.230022Z"},"links":{"cited_paper":"/paper/2303.04137","citing_paper":"/paper/2508.17230"},"observation_digest":"sha256:6acfbcb3e89cb6fe1a4ff41c7903fbd9a1d17c557b1f1c1441570c962b3b3e58","observation_id":"342b70fd-7065-47be-b0f9-bb647dbf006c","resolution":{"observed_at":"2026-08-05T17:03:21.230022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:03:22.306081Z","title":"An unbiased look at datasets for visuo-motor pre-training","venue":null,"work_id":"7b786ce0-1433-4e14-8c7e-14a3be746361","year":null},"citing_paper":{"arxiv_id":"2508.17230","last_updated":"2025-09-06T14:24:21Z","snapshot_observed_at":"2026-08-14T16:39:29.021901Z","submitted_at":"2025-08-24T07:06:56Z","title":"4D Visual Pre-training for Robot Learning","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T17:03:21.235078Z"},"links":{"citing_paper":"/paper/2508.17230"},"observation_digest":"sha256:cd01838e04d299a549e85b89d54bb3aab8d071484c85f5a9d6f4e0489ee48e4b","observation_id":"080d14c6-c09b-47f0-a02b-db9d260702ed","resolution":{"observed_at":"2026-08-05T17:03:22.311444Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:03:21.239383Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2508.17230","last_updated":"2025-09-06T14:24:21Z","snapshot_observed_at":"2026-08-14T16:39:29.021901Z","submitted_at":"2025-08-24T07:06:56Z","title":"4D Visual Pre-training for Robot Learning","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T17:03:21.239383Z"},"links":{"citing_paper":"/paper/2508.17230"},"observation_digest":"sha256:81ad4111307264f402020ead9266c5ff3b05ea071a3346cb698ad76247e17306","observation_id":"a5c3e32a-eacd-4969-9d67-60d8dc9eb804","resolution":{"observed_at":"2026-08-05T17:03:21.239383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:03:22.280925Z","title":"Implicit behavioral cloning, 2021","venue":null,"work_id":"ba827cf7-a8a6-4d89-905c-8303a1a683ba","year":2021},"citing_paper":{"arxiv_id":"2508.17230","last_updated":"2025-09-06T14:24:21Z","snapshot_observed_at":"2026-08-14T16:39:29.021901Z","submitted_at":"2025-08-24T07:06:56Z","title":"4D Visual Pre-training for Robot Learning","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T17:03:21.243345Z"},"links":{"citing_paper":"/paper/2508.17230"},"observation_digest":"sha256:6fedf7b4107f864f8fbc628fb6646615597d55689a4b363848ef84cceb376d93","observation_id":"fe6f73e4-40b5-457f-b7bc-28a6fa23caca","resolution":{"observed_at":"2026-08-05T17:03:22.285073Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:03:22.266733Z","title":"Mobile aloha: Learning bimanual mobile manipulation using low-cost whole-body teleoperation","venue":null,"work_id":"0a15c270-0b5b-4e3a-add6-fb1fec6819e0","year":2024},"citing_paper":{"arxiv_id":"2508.17230","last_updated":"2025-09-06T14:24:21Z","snapshot_observed_at":"2026-08-14T16:39:29.021901Z","submitted_at":"2025-08-24T07:06:56Z","title":"4D Visual Pre-training for Robot Learning","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T17:03:21.247675Z"},"links":{"citing_paper":"/paper/2508.17230"},"observation_digest":"sha256:1e88842d0aa217c5c59a6b71b21dc2ddef6a627490fbd4056ef213181264f264","observation_id":"c6797594-bb4b-411a-bd3a-acd7e4450313","resolution":{"observed_at":"2026-08-05T17:03:22.270882Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.17817","last_updated":"2023-10-19T19:36:31Z","snapshot_observed_at":"2026-08-16T15:19:39.714681Z","submitted_at":"2023-06-30T17:34:06Z","title":"Act3D: 3D Feature Field Transformers for Multi-Task Robotic Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.17817","snapshot_observed_at":"2026-08-05T17:03:21.251510Z","title":"Act3d: Infinite resolution action detec- tion transformer for robotic manipulation.arXiv preprint arXiv:2306.17817, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.17230","last_updated":"2025-09-06T14:24:21Z","snapshot_observed_at":"2026-08-14T16:39:29.021901Z","submitted_at":"2025-08-24T07:06:56Z","title":"4D Visual Pre-training for Robot Learning","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T17:03:21.251510Z"},"links":{"cited_paper":"/paper/2306.17817","citing_paper":"/paper/2508.17230"},"observation_digest":"sha256:2a3bbb4752a898984b29a911ef82b0e5092a67057937ff4d1f8ca1082025fd3a","observation_id":"46de06a7-c92b-41d2-a328-70e47d45189a","resolution":{"observed_at":"2026-08-05T17:03:21.251510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:03:21.256034Z","title":"Rvt: Robotic view transformer for 3d object manipulation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.17230","last_updated":"2025-09-06T14:24:21Z","snapshot_observed_at":"2026-08-14T16:39:29.021901Z","submitted_at":"2025-08-24T07:06:56Z","title":"4D Visual Pre-training for Robot Learning","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T17:03:21.256034Z"},"links":{"citing_paper":"/paper/2508.17230"},"observation_digest":"sha256:1abce3825dccb3fe9127c2a438821f6feda39132278417e99dbf996cfc2f5725","observation_id":"2b504652-2d46-471b-9b87-7fbefc7645a0","resolution":{"observed_at":"2026-08-05T17:03:21.256034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:03:21.260015Z","title":"Ego4d: Around the world in 3,000 hours of egocentric video","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.17230","last_updated":"2025-09-06T14:24:21Z","snapshot_observed_at":"2026-08-14T16:39:29.021901Z","submitted_at":"2025-08-24T07:06:56Z","title":"4D Visual Pre-training for Robot Learning","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T17:03:21.260015Z"},"links":{"citing_paper":"/paper/2508.17230"},"observation_digest":"sha256:32026ca6cf8e1176069a7fc2fcf389b7a9d6aa2a5fb07ef84c3d6e47af8754a4","observation_id":"1870c50b-f686-4f1c-9515-cb016b6942d0","resolution":{"observed_at":"2026-08-05T17:03:21.260015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:03:21.263906Z","title":"Denoising dif- fusion probabilistic models.Advances in neural information processing systems, 33:6840–6851, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.17230","last_updated":"2025-09-06T14:24:21Z","snapshot_observed_at":"2026-08-14T16:39:29.021901Z","submitted_at":"2025-08-24T07:06:56Z","title":"4D Visual Pre-training for Robot Learning","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T17:03:21.263906Z"},"links":{"citing_paper":"/paper/2508.17230"},"observation_digest":"sha256:0a6587b53d7ce824fbfd5e15cb9e50f34a37f6c95b4d6cd0626f038592396aa7","observation_id":"dd8634bf-ca7c-421b-a163-a6e0de0fb295","resolution":{"observed_at":"2026-08-05T17:03:21.263906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:03:22.226609Z","title":"Spatio-temporal self-supervised representation learning for 3d point clouds","venue":null,"work_id":"5279a804-259f-4ac7-83f4-d1cfe70c4a32","year":null},"citing_paper":{"arxiv_id":"2508.17230","last_updated":"2025-09-06T14:24:21Z","snapshot_observed_at":"2026-08-14T16:39:29.021901Z","submitted_at":"2025-08-24T07:06:56Z","title":"4D Visual Pre-training for Robot Learning","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T17:03:21.267884Z"},"links":{"citing_paper":"/paper/2508.17230"},"observation_digest":"sha256:1b1d4363f1cf05de14dbcdcc2246bbd99c7ee4ec0b9fb89ece28fd3f71dbca46","observation_id":"ccfc23a4-d579-4898-8f7e-a97b12171a8f","resolution":{"observed_at":"2026-08-05T17:03:22.231230Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14134","last_updated":"2024-08-09T03:06:42Z","snapshot_observed_at":"2026-08-16T14:32:27.603486Z","submitted_at":"2023-12-21T18:55:05Z","title":"Diffusion Reward: Learning Rewards via Conditional Video Diffusion","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14134","snapshot_observed_at":"2026-08-05T17:03:21.271906Z","title":"Dif- fusion reward: Learning rewards via conditional video diffu- sion.arXiv preprint arXiv:2312.14134, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.17230","last_updated":"2025-09-06T14:24:21Z","snapshot_observed_at":"2026-08-14T16:39:29.021901Z","submitted_at":"2025-08-24T07:06:56Z","title":"4D Visual Pre-training for Robot Learning","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T17:03:21.271906Z"},"links":{"cited_paper":"/paper/2312.14134","citing_paper":"/paper/2508.17230"},"observation_digest":"sha256:0d68d54ffda024082509aa8a745a3a1ab0a91a4b71eaef3eaec5ce0ef70f2d6c","observation_id":"bd3e5533-a953-4d6f-8a46-80ed849f5f90","resolution":{"observed_at":"2026-08-05T17:03:21.271906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17901","last_updated":"2023-11-29T18:53:34Z","snapshot_observed_at":"2026-08-16T14:39:07.550564Z","submitted_at":"2023-11-29T18:53:34Z","title":"SODA: Bottleneck Diffusion Models for Representation Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17901","snapshot_observed_at":"2026-08-05T17:03:21.276099Z","title":"Soda: Bottleneck diffusion models for representation learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.17230","last_updated":"2025-09-06T14:24:21Z","snapshot_observed_at":"2026-08-14T16:39:29.021901Z","submitted_at":"2025-08-24T07:06:56Z","title":"4D Visual Pre-training for Robot Learning","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T17:03:21.276099Z"},"links":{"cited_paper":"/paper/2311.17901","citing_paper":"/paper/2508.17230"},"observation_digest":"sha256:36371a52611acba44ca64507968a5664f0b17ae0a4f9957642e7d9bb8d3de348","observation_id":"6beb5b35-e348-4134-bc37-0d3edd306821","resolution":{"observed_at":"2026-08-05T17:03:21.276099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:03:22.212742Z","title":"Equilibrium free-energy differences from nonequilibrium measurements: A master-equation ap- proach.Physical Review E, 56(5):5018, 1997","venue":null,"work_id":"020b1e1f-b2eb-476c-9b39-18ebfd45491a","year":1997},"citing_paper":{"arxiv_id":"2508.17230","last_updated":"2025-09-06T14:24:21Z","snapshot_observed_at":"2026-08-14T16:39:29.021901Z","submitted_at":"2025-08-24T07:06:56Z","title":"4D Visual Pre-training for Robot Learning","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T17:03:21.280367Z"},"links":{"citing_paper":"/paper/2508.17230"},"observation_digest":"sha256:456340cdf85a18766d800f03500bf756f5e2321b5013c81b324ae46be799bde4","observation_id":"2386e89f-27f0-4fd7-82d2-4ae15162be01","resolution":{"observed_at":"2026-08-05T17:03:22.217786Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07864","last_updated":"2025-03-01T08:57:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-10T12:33:46Z","title":"RDT-1B: a Diffusion Foundation Model for Bimanual Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07864","snapshot_observed_at":"2026-08-05T17:03:21.284052Z","title":"Rdt-1b: a diffusion foundation model for bimanual manipu- lation.arXiv preprint arXiv:2410.07864, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.17230","last_updated":"2025-09-06T14:24:21Z","snapshot_observed_at":"2026-08-14T16:39:29.021901Z","submitted_at":"2025-08-24T07:06:56Z","title":"4D Visual Pre-training for Robot Learning","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T17:03:21.284052Z"},"links":{"cited_paper":"/paper/2410.07864","citing_paper":"/paper/2508.17230"},"observation_digest":"sha256:8a7a5c56a938cad02a58d56415f3862f74b72cbd8ccd140e1c05fcfa71773a7a","observation_id":"e70ad54d-784e-41ca-9509-eec2899144b2","resolution":{"observed_at":"2026-08-05T17:03:21.284052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:03:22.200090Z","title":"Point- voxel cnn for efficient 3d deep learning.Advances in neural information processing systems, 32, 2019","venue":null,"work_id":"81a6a755-51e9-4525-a81a-1b76c314498f","year":2019},"citing_paper":{"arxiv_id":"2508.17230","last_updated":"2025-09-06T14:24:21Z","snapshot_observed_at":"2026-08-14T16:39:29.021901Z","submitted_at":"2025-08-24T07:06:56Z","title":"4D Visual Pre-training for Robot Learning","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T17:03:21.288110Z"},"links":{"citing_paper":"/paper/2508.17230"},"observation_digest":"sha256:d0f3dac426e7c698fd19b9970862e8c0fc1b4646cc8c5f3a894b88b252e11390","observation_id":"3c498518-9db0-48d2-87c9-381072874f5e","resolution":{"observed_at":"2026-08-05T17:03:22.204285Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:03:22.187705Z","title":"Where are we in the search for an artificial visual cortex for embodied intelli- gence?Advances in Neural Information Processing Systems, 36, 2024","venue":null,"work_id":"bdad6906-7936-4e7d-aeb8-61fd82291bbf","year":2024},"citing_paper":{"arxiv_id":"2508.17230","last_updated":"2025-09-06T14:24:21Z","snapshot_observed_at":"2026-08-14T16:39:29.021901Z","submitted_at":"2025-08-24T07:06:56Z","title":"4D Visual Pre-training for Robot Learning","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T17:03:21.291729Z"},"links":{"citing_paper":"/paper/2508.17230"},"observation_digest":"sha256:680bff3a700af2e5c8b21f81c05584d3a597b7094647ea877b15a8f08b19719a","observation_id":"c2315448-5b1d-40e2-b8e8-bb1a31c695e6","resolution":{"observed_at":"2026-08-05T17:03:22.191842Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:03:22.174094Z","title":"What mat- ters in learning from offline human demonstrations for robot manipulation, 2021","venue":null,"work_id":"bbfdaf24-d7f9-4eb8-8fbc-36f6f75c2553","year":2021},"citing_paper":{"arxiv_id":"2508.17230","last_updated":"2025-09-06T14:24:21Z","snapshot_observed_at":"2026-08-14T16:39:29.021901Z","submitted_at":"2025-08-24T07:06:56Z","title":"4D Visual Pre-training for Robot Learning","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T17:03:21.295581Z"},"links":{"citing_paper":"/paper/2508.17230"},"observation_digest":"sha256:47a60e7fef844aa3a9a336854865b4e4266e1f5396996b16ef26f58323763fc7","observation_id":"0f1c4598-5ea5-478c-865a-46dbad63b42e","resolution":{"observed_at":"2026-08-05T17:03:22.178483Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:03:22.160709Z","title":"Self-supervised point cloud prediction using 3d spatio-temporal convolutional networks","venue":null,"work_id":"7e137ae8-8138-4ad4-8211-eb291bbf0596","year":2022},"citing_paper":{"arxiv_id":"2508.17230","last_updated":"2025-09-06T14:24:21Z","snapshot_observed_at":"2026-08-14T16:39:29.021901Z","submitted_at":"2025-08-24T07:06:56Z","title":"4D Visual Pre-training for Robot Learning","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T17:03:21.299132Z"},"links":{"citing_paper":"/paper/2508.17230"},"observation_digest":"sha256:b46f528d185bd549546e01c1ac56222660499edcfcdfe3f9f05929def4b5ce9d","observation_id":"15af83ac-f03b-4365-b84c-63b1c1091ae3","resolution":{"observed_at":"2026-08-05T17:03:22.165293Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.12601","last_updated":"2022-11-18T05:57:09Z","snapshot_observed_at":"2026-08-11T08:36:53.636356Z","submitted_at":"2022-03-23T17:55:09Z","title":"R3M: A Universal Visual Representation for Robot Manipulation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.12601","snapshot_observed_at":"2026-08-05T17:03:21.302768Z","title":"R3m: A universal visual representation for robot manipulation.arXiv preprint arXiv:2203.12601, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.17230","last_updated":"2025-09-06T14:24:21Z","snapshot_observed_at":"2026-08-14T16:39:29.021901Z","submitted_at":"2025-08-24T07:06:56Z","title":"4D Visual Pre-training for Robot Learning","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T17:03:21.302768Z"},"links":{"cited_paper":"/paper/2203.12601","citing_paper":"/paper/2508.17230"},"observation_digest":"sha256:0d5893bc78e3aaf8d8034eecaffadc066842c847d17f4ac3bf1e6631603e3335","observation_id":"f22873ba-802a-4dab-8b1d-4e9684a4ecff","resolution":{"observed_at":"2026-08-05T17:03:21.302768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:03:22.147824Z","title":"Henriques","venue":null,"work_id":"10201f30-c253-4810-9f96-9fb6d82ade58","year":2023},"citing_paper":{"arxiv_id":"2508.17230","last_updated":"2025-09-06T14:24:21Z","snapshot_observed_at":"2026-08-14T16:39:29.021901Z","submitted_at":"2025-08-24T07:06:56Z","title":"4D Visual Pre-training for Robot Learning","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T17:03:21.306611Z"},"links":{"citing_paper":"/paper/2508.17230"},"observation_digest":"sha256:ad2db7d6868d2530f5c173caec6992c293be954888eec38a9c2a869377e03d84","observation_id":"0fe27fdf-95fd-4700-b6cf-bc3b8bad835c","resolution":{"observed_at":"2026-08-05T17:03:22.151794Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08864","last_updated":"2025-05-14T15:22:36Z","snapshot_observed_at":"2026-08-13T13:59:48.091257Z","submitted_at":"2023-10-13T05:20:40Z","title":"Open X-Embodiment: Robotic Learning Datasets and RT-X Models","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08864","snapshot_observed_at":"2026-08-05T17:03:21.310338Z","title":"Open x-embodiment: Robotic learning datasets and rt-x models.arXiv preprint arXiv:2310.08864, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.17230","last_updated":"2025-09-06T14:24:21Z","snapshot_observed_at":"2026-08-14T16:39:29.021901Z","submitted_at":"2025-08-24T07:06:56Z","title":"4D Visual Pre-training for Robot Learning","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T17:03:21.310338Z"},"links":{"cited_paper":"/paper/2310.08864","citing_paper":"/paper/2508.17230"},"observation_digest":"sha256:5b214b47687d3f8d726526919516031b9041f2c61bdfc6deb811aba4af87faf2","observation_id":"6b24ad63-b50d-469b-a89c-1e25287e20ed","resolution":{"observed_at":"2026-08-05T17:03:21.310338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:03:22.133683Z","title":"Masked autoencoders for point cloud self-supervised learning","venue":null,"work_id":"bd54f8dc-cdc1-4805-b5cb-a4abcdaaf71f","year":2022},"citing_paper":{"arxiv_id":"2508.17230","last_updated":"2025-09-06T14:24:21Z","snapshot_observed_at":"2026-08-14T16:39:29.021901Z","submitted_at":"2025-08-24T07:06:56Z","title":"4D Visual Pre-training for Robot Learning","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T17:03:21.314258Z"},"links":{"citing_paper":"/paper/2508.17230"},"observation_digest":"sha256:9ed66c92bc06ef76fc1e1b3cddde50ed48da0c85ad8c5213db5efea4874c2853","observation_id":"a95946da-2f04-4e23-be52-f1fb9e04c6aa","resolution":{"observed_at":"2026-08-05T17:03:22.138718Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:03:22.120215Z","title":"Recon- structing hands in 3d with transformers","venue":null,"work_id":"c687cc5e-ac40-41bd-b76f-322070ce03ed","year":2024},"citing_paper":{"arxiv_id":"2508.17230","last_updated":"2025-09-06T14:24:21Z","snapshot_observed_at":"2026-08-14T16:39:29.021901Z","submitted_at":"2025-08-24T07:06:56Z","title":"4D Visual Pre-training for Robot Learning","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T17:03:21.317885Z"},"links":{"citing_paper":"/paper/2508.17230"},"observation_digest":"sha256:632e9eb3c7570b7fda48468286e0e684b3cb21d957650ef00531674b3d3e5997","observation_id":"ea8bc1c0-84f5-4536-b868-67f7ae53481d","resolution":{"observed_at":"2026-08-05T17:03:22.124476Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:03:22.105823Z","title":"Pointnet++: Deep hierarchical feature learning on point sets in a metric space.Advances in neural information processing systems, 30, 2017","venue":null,"work_id":"07ca3e97-2aca-4889-997f-bf68aa9a68db","year":2017},"citing_paper":{"arxiv_id":"2508.17230","last_updated":"2025-09-06T14:24:21Z","snapshot_observed_at":"2026-08-14T16:39:29.021901Z","submitted_at":"2025-08-24T07:06:56Z","title":"4D Visual Pre-training for Robot Learning","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T17:03:21.321493Z"},"links":{"citing_paper":"/paper/2508.17230"},"observation_digest":"sha256:da6f60f0ea834506430cc2bacbdf7e98cc8a1eb6d447b92c8e5949fb2557c76f","observation_id":"873be75f-5acb-4648-bb70-3c580c09c8d2","resolution":{"observed_at":"2026-08-05T17:03:22.110432Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:03:22.092696Z","title":"Dexmv: Imita- tion learning for dexterous manipulation from human videos,","venue":null,"work_id":"be08fc89-259c-467a-8a47-05671cfa410c","year":null},"citing_paper":{"arxiv_id":"2508.17230","last_updated":"2025-09-06T14:24:21Z","snapshot_observed_at":"2026-08-14T16:39:29.021901Z","submitted_at":"2025-08-24T07:06:56Z","title":"4D Visual Pre-training for Robot Learning","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T17:03:21.325644Z"},"links":{"citing_paper":"/paper/2508.17230"},"observation_digest":"sha256:519cf3167d888df78117c4a5ab822d615d87d22d9e127b54643d93d3e7667045","observation_id":"8df40319-180d-46a0-85e5-20a73191b6b3","resolution":{"observed_at":"2026-08-05T17:03:22.096738Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04577","last_updated":"2024-05-16T21:14:44Z","snapshot_observed_at":"2026-08-16T15:17:27.338758Z","submitted_at":"2023-07-10T14:11:07Z","title":"AnyTeleop: A General Vision-Based Dexterous Robot Arm-Hand Teleoperation System","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.04577","snapshot_observed_at":"2026-08-05T17:03:21.329618Z","title":"Anyteleop: A general vision-based dexterous robot arm-hand teleoperation system.arXiv preprint arXiv:2307.04577, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.17230","last_updated":"2025-09-06T14:24:21Z","snapshot_observed_at":"2026-08-14T16:39:29.021901Z","submitted_at":"2025-08-24T07:06:56Z","title":"4D Visual Pre-training for Robot Learning","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T17:03:21.329618Z"},"links":{"cited_paper":"/paper/2307.04577","citing_paper":"/paper/2508.17230"},"observation_digest":"sha256:dc21367d28953a2cd5aedac39256d3946955315e6262f1ee9bcf216185ac304f","observation_id":"587b6cd7-41b6-42ad-b69b-bbbaf3b0cb7b","resolution":{"observed_at":"2026-08-05T17:03:21.329618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:03:22.079703Z","title":"Robot learning with sen- sorimotor pre-training","venue":null,"work_id":"0719f714-669b-4d3f-935b-51c9f619f649","year":2023},"citing_paper":{"arxiv_id":"2508.17230","last_updated":"2025-09-06T14:24:21Z","snapshot_observed_at":"2026-08-14T16:39:29.021901Z","submitted_at":"2025-08-24T07:06:56Z","title":"4D Visual Pre-training for Robot Learning","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T17:03:21.333713Z"},"links":{"citing_paper":"/paper/2508.17230"},"observation_digest":"sha256:a4251bc556a26ae0b6be848a9abbd1195554c0e4d57eaeb8c127eb826ce7a1b6","observation_id":"6ff6bb74-1dcb-46bc-b59d-99192dcf5c15","resolution":{"observed_at":"2026-08-05T17:03:22.083894Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:03:22.066253Z","title":"Real-world robot learn- ing with masked visual pre-training","venue":null,"work_id":"98f05132-05d8-4ac5-9778-9272f4dce42c","year":2023},"citing_paper":{"arxiv_id":"2508.17230","last_updated":"2025-09-06T14:24:21Z","snapshot_observed_at":"2026-08-14T16:39:29.021901Z","submitted_at":"2025-08-24T07:06:56Z","title":"4D Visual Pre-training for Robot Learning","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T17:03:21.337505Z"},"links":{"citing_paper":"/paper/2508.17230"},"observation_digest":"sha256:ee5e306f0616ced015f3f8a94b24a5e1fe54bf239257d3090bc56cbf6b362634","observation_id":"01aea381-36a0-446c-ae4a-6c80dead3cb8","resolution":{"observed_at":"2026-08-05T17:03:22.070451Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1709.10087","last_updated":"2018-06-26T13:31:37Z","snapshot_observed_at":"2026-08-15T17:49:11.636243Z","submitted_at":"2017-09-28T17:51:13Z","title":"Learning Complex Dexterous Manipulation with Deep Reinforcement Learning and Demonstrations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1709.10087","snapshot_observed_at":"2026-08-05T17:03:21.341137Z","title":"Learning complex dexterous manipulation with deep reinforcement learning and demonstrations.arXiv preprint arXiv:1709.10087, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2508.17230","last_updated":"2025-09-06T14:24:21Z","snapshot_observed_at":"2026-08-14T16:39:29.021901Z","submitted_at":"2025-08-24T07:06:56Z","title":"4D Visual Pre-training for Robot Learning","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T17:03:21.341137Z"},"links":{"cited_paper":"/paper/1709.10087","citing_paper":"/paper/2508.17230"},"observation_digest":"sha256:bd3770225541ad5fb8ebc6a08664b83c216990f2b774cdf9965d8699ed8b5aa1","observation_id":"7819deb8-c349-417d-aa66-fb36aa512f19","resolution":{"observed_at":"2026-08-05T17:03:21.341137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:03:22.053673Z","title":"Learning complex dexterous manipulation with deep reinforcement learning and demonstrations, 2018","venue":null,"work_id":"575a3ad4-4b45-4b67-b8dd-c2d2206d3201","year":2018},"citing_paper":{"arxiv_id":"2508.17230","last_updated":"2025-09-06T14:24:21Z","snapshot_observed_at":"2026-08-14T16:39:29.021901Z","submitted_at":"2025-08-24T07:06:56Z","title":"4D Visual Pre-training for Robot Learning","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T17:03:21.345166Z"},"links":{"citing_paper":"/paper/2508.17230"},"observation_digest":"sha256:803f49867a7b658dc97e5f3f7c1a2be256c7fb7c21db90dbc3d79e051f442fe5","observation_id":"7219eb5c-e32d-48ec-b163-99877d0db233","resolution":{"observed_at":"2026-08-05T17:03:22.057737Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:03:21.349065Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.17230","last_updated":"2025-09-06T14:24:21Z","snapshot_observed_at":"2026-08-14T16:39:29.021901Z","submitted_at":"2025-08-24T07:06:56Z","title":"4D Visual Pre-training for Robot Learning","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T17:03:21.349065Z"},"links":{"citing_paper":"/paper/2508.17230"},"observation_digest":"sha256:b4385c1608ee75fffb313ca7ca70086428754d42c7d0d40a313d43d2f2633801","observation_id":"83e69080-267e-4218-a39e-0ae7159eb3d6","resolution":{"observed_at":"2026-08-05T17:03:21.349065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:03:22.030644Z","title":"On bringing robots home, 2023","venue":null,"work_id":"3dcdcc82-65c0-4bcc-883d-4453d56e91fb","year":2023},"citing_paper":{"arxiv_id":"2508.17230","last_updated":"2025-09-06T14:24:21Z","snapshot_observed_at":"2026-08-14T16:39:29.021901Z","submitted_at":"2025-08-24T07:06:56Z","title":"4D Visual Pre-training for Robot Learning","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T17:03:21.352885Z"},"links":{"citing_paper":"/paper/2508.17230"},"observation_digest":"sha256:831b28108d9bc18981d6a1d803482a94d65126fc56e3b856cc6566417f4a6211","observation_id":"6d495e07-46de-4594-870b-be071a7cf748","resolution":{"observed_at":"2026-08-05T17:03:22.035067Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03380","last_updated":"2021-11-11T19:06:52Z","snapshot_observed_at":"2026-08-16T18:11:38.245504Z","submitted_at":"2021-07-07T17:59:07Z","title":"RRL: Resnet as representation for Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03380","snapshot_observed_at":"2026-08-05T17:03:21.357019Z","title":"Rrl: Resnet as rep- resentation for reinforcement learning.arXiv preprint arXiv:2107.03380, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.17230","last_updated":"2025-09-06T14:24:21Z","snapshot_observed_at":"2026-08-14T16:39:29.021901Z","submitted_at":"2025-08-24T07:06:56Z","title":"4D Visual Pre-training for Robot Learning","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T17:03:21.357019Z"},"links":{"cited_paper":"/paper/2107.03380","citing_paper":"/paper/2508.17230"},"observation_digest":"sha256:25af6281f66b88749d283426d5098f98d7b44844da2a11823893ba3fc3ab3e5c","observation_id":"cf8d3867-1c0e-4240-9737-d6ee8115d10d","resolution":{"observed_at":"2026-08-05T17:03:21.357019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:03:21.361117Z","title":"Perceiver- actor: A multi-task transformer for robotic manipulation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.17230","last_updated":"2025-09-06T14:24:21Z","snapshot_observed_at":"2026-08-14T16:39:29.021901Z","submitted_at":"2025-08-24T07:06:56Z","title":"4D Visual Pre-training for Robot Learning","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-05T17:03:21.361117Z"},"links":{"citing_paper":"/paper/2508.17230"},"observation_digest":"sha256:85c905e9f260e6d29b30fa88985e5e38c07a06e02f6c34c2bdae80b3db2bd0db","observation_id":"95454da0-576b-4b4e-b3a7-4e83b7279563","resolution":{"observed_at":"2026-08-05T17:03:21.361117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:03:22.005526Z","title":"Shelving, stacking, hanging: Relational pose diffusion for multi-modal rearrangement, 2023","venue":null,"work_id":"b4394d8b-ea21-4844-a00a-dd0a2238bc08","year":2023},"citing_paper":{"arxiv_id":"2508.17230","last_updated":"2025-09-06T14:24:21Z","snapshot_observed_at":"2026-08-14T16:39:29.021901Z","submitted_at":"2025-08-24T07:06:56Z","title":"4D Visual Pre-training for Robot Learning","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-05T17:03:21.364875Z"},"links":{"citing_paper":"/paper/2508.17230"},"observation_digest":"sha256:8ed1e4a3dfd54bb1b61d9e36abb6fed1f5eec0919374771e055cfa55f3a1640c","observation_id":"49078f5f-c4b8-47b6-a274-86a6d7c86745","resolution":{"observed_at":"2026-08-05T17:03:22.009913Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-08-11T15:38:14.931716Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-05T17:03:21.368501Z","title":"Denoising diffusion implicit models.arXiv preprint arXiv:2010.02502, 2020","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2508.17230","last_updated":"2025-09-06T14:24:21Z","snapshot_observed_at":"2026-08-14T16:39:29.021901Z","submitted_at":"2025-08-24T07:06:56Z","title":"4D Visual Pre-training for Robot Learning","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-05T17:03:21.368501Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2508.17230"},"observation_digest":"sha256:e89cc33d97ecede4311acddb7c2720a681f4513ba3be6408ab81562db7911275","observation_id":"9f46b6ad-ee52-44f0-80a0-87d9a34d2370","resolution":{"observed_at":"2026-08-05T17:03:21.368501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2011.13456","last_updated":"2021-02-10T18:17:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-11-26T19:39:10Z","title":"Score-Based Generative Modeling through Stochastic Differential Equations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.13456","snapshot_observed_at":"2026-08-05T17:03:21.372448Z","title":"Score-based generative modeling through stochastic differential equa- tions.arXiv preprint arXiv:2011.13456, 2020","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2508.17230","last_updated":"2025-09-06T14:24:21Z","snapshot_observed_at":"2026-08-14T16:39:29.021901Z","submitted_at":"2025-08-24T07:06:56Z","title":"4D Visual Pre-training for Robot Learning","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-05T17:03:21.372448Z"},"links":{"cited_paper":"/paper/2011.13456","citing_paper":"/paper/2508.17230"},"observation_digest":"sha256:1e8c279d1188591637c8427f00245178fe2e7324521ee1e17171bdfc919974bd","observation_id":"96721581-04c8-4a0b-a2f2-303837a39311","resolution":{"observed_at":"2026-08-05T17:03:21.372448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:03:21.991050Z","title":"Memory-consistent neural networks for imitation learning, 2024","venue":null,"work_id":"a09e1e51-0e65-45d0-86eb-5c39c88927e4","year":2024},"citing_paper":{"arxiv_id":"2508.17230","last_updated":"2025-09-06T14:24:21Z","snapshot_observed_at":"2026-08-14T16:39:29.021901Z","submitted_at":"2025-08-24T07:06:56Z","title":"4D Visual Pre-training for Robot Learning","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-05T17:03:21.376270Z"},"links":{"citing_paper":"/paper/2508.17230"},"observation_digest":"sha256:4655546e1d193968c132943445a163e213b4c6408070cef55fdbe5389116e5c0","observation_id":"1444e2da-ffe5-44fb-9b2e-0c47c5c6a110","resolution":{"observed_at":"2026-08-05T17:03:21.995667Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:03:21.977087Z","title":"Mujoco: A physics engine for model-based control","venue":null,"work_id":"602cd0e9-bd1c-414a-961e-3b85272d2201","year":2012},"citing_paper":{"arxiv_id":"2508.17230","last_updated":"2025-09-06T14:24:21Z","snapshot_observed_at":"2026-08-14T16:39:29.021901Z","submitted_at":"2025-08-24T07:06:56Z","title":"4D Visual Pre-training for Robot Learning","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-05T17:03:21.380078Z"},"links":{"citing_paper":"/paper/2508.17230"},"observation_digest":"sha256:be53b308c9be5e9d8312a959b90ed7dd25cb3f4c51f239f431c22dc12a27c91c","observation_id":"bc7977ff-7c9b-41fa-9420-907c6db02869","resolution":{"observed_at":"2026-08-05T17:03:21.981393Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:03:21.963569Z","title":"Se(3)-diffusionfields: Learning smooth cost func- tions for joint grasp and motion optimization through diffu- sion, 2023","venue":null,"work_id":"8baf76e1-6ad1-454c-9817-ad64e50a584e","year":2023},"citing_paper":{"arxiv_id":"2508.17230","last_updated":"2025-09-06T14:24:21Z","snapshot_observed_at":"2026-08-14T16:39:29.021901Z","submitted_at":"2025-08-24T07:06:56Z","title":"4D Visual Pre-training for Robot Learning","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-05T17:03:21.384022Z"},"links":{"citing_paper":"/paper/2508.17230"},"observation_digest":"sha256:de13172d17d97fbd21a9964cd8f78fb1632f48adf30975add9750b8978c51056","observation_id":"585ba0d6-7156-49ef-b8b0-cab3c9a8a156","resolution":{"observed_at":"2026-08-05T17:03:21.967856Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12281","last_updated":"2024-09-10T15:28:58Z","snapshot_observed_at":"2026-08-16T13:59:42.878901Z","submitted_at":"2024-04-18T15:57:19Z","title":"RISE: 3D Perception Makes Real-World Robot Imitation Simple and Effective","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12281","snapshot_observed_at":"2026-08-05T17:03:21.388478Z","title":"Rise: 3d perception makes real-world robot imitation simple and effective.arXiv preprint arXiv:2404.12281, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.17230","last_updated":"2025-09-06T14:24:21Z","snapshot_observed_at":"2026-08-14T16:39:29.021901Z","submitted_at":"2025-08-24T07:06:56Z","title":"4D Visual Pre-training for Robot Learning","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-05T17:03:21.388478Z"},"links":{"cited_paper":"/paper/2404.12281","citing_paper":"/paper/2508.17230"},"observation_digest":"sha256:867bf50f45c8ab190b5decf107dcd9f6f5c6febe66ebd4d4e94d6f4a723c5de1","observation_id":"036d5778-04d8-49ac-bae7-4f680b674757","resolution":{"observed_at":"2026-08-05T17:03:21.388478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01812","last_updated":"2024-10-15T14:50:29Z","snapshot_observed_at":"2026-08-16T13:37:56.835987Z","submitted_at":"2024-07-01T21:23:26Z","title":"Equivariant Diffusion Policy","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01812","snapshot_observed_at":"2026-08-05T17:03:21.392455Z","title":"Equivariant diffusion pol- icy.arXiv preprint arXiv:2407.01812, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.17230","last_updated":"2025-09-06T14:24:21Z","snapshot_observed_at":"2026-08-14T16:39:29.021901Z","submitted_at":"2025-08-24T07:06:56Z","title":"4D Visual Pre-training for Robot Learning","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-05T17:03:21.392455Z"},"links":{"cited_paper":"/paper/2407.01812","citing_paper":"/paper/2508.17230"},"observation_digest":"sha256:4e9940de20dc5883393327d983619d5906328a9ef6fd73bf9c1d61f3d4d63e2f","observation_id":"a11434cf-28ad-42a3-a12e-98d85db0e938","resolution":{"observed_at":"2026-08-05T17:03:21.392455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:03:21.950649Z","title":"Diffusion models as masked autoencoders","venue":null,"work_id":"a6a84c95-52e9-4313-bb7c-411c3c4adba0","year":2023},"citing_paper":{"arxiv_id":"2508.17230","last_updated":"2025-09-06T14:24:21Z","snapshot_observed_at":"2026-08-14T16:39:29.021901Z","submitted_at":"2025-08-24T07:06:56Z","title":"4D Visual Pre-training for Robot Learning","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-05T17:03:21.396448Z"},"links":{"citing_paper":"/paper/2508.17230"},"observation_digest":"sha256:22ef3d74394da4b03fed854c37bfa153c94c030efb722544496f0e227ed45b50","observation_id":"3814d33a-265c-484a-948c-05b98b483286","resolution":{"observed_at":"2026-08-05T17:03:21.954631Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13877","last_updated":"2025-05-27T01:46:53Z","snapshot_observed_at":"2026-08-15T09:21:12.808847Z","submitted_at":"2024-12-18T14:17:16Z","title":"RoboMIND: Benchmark on Multi-embodiment Intelligence Normative Data for Robot Manipulation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.13877","snapshot_observed_at":"2026-08-05T17:03:21.400105Z","title":"Robomind: Benchmark on multi- embodiment intelligence normative data for robot manipula- tion.arXiv preprint arXiv:2412.13877, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.17230","last_updated":"2025-09-06T14:24:21Z","snapshot_observed_at":"2026-08-14T16:39:29.021901Z","submitted_at":"2025-08-24T07:06:56Z","title":"4D Visual Pre-training for Robot Learning","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-05T17:03:21.400105Z"},"links":{"cited_paper":"/paper/2412.13877","citing_paper":"/paper/2508.17230"},"observation_digest":"sha256:4cb42713204bdba490c1c8376c347f3a10254e338f06ff0fb2f5a372d3c2bd3f","observation_id":"b26cf4c9-f623-4209-9d3e-215b8295e897","resolution":{"observed_at":"2026-08-05T17:03:21.400105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:03:21.936747Z","title":"Tiangong.https://x-humanoid.com/ bt.html, 2025","venue":null,"work_id":"ed5a79b9-987b-4d14-a2fb-d6ccd0a6dd42","year":2025},"citing_paper":{"arxiv_id":"2508.17230","last_updated":"2025-09-06T14:24:21Z","snapshot_observed_at":"2026-08-14T16:39:29.021901Z","submitted_at":"2025-08-24T07:06:56Z","title":"4D Visual Pre-training for Robot Learning","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-05T17:03:21.404049Z"},"links":{"citing_paper":"/paper/2508.17230"},"observation_digest":"sha256:68b902a51ce7e1a612c93b580d6230cfafba72490d0aabcee1e58793e0f5c2cf","observation_id":"f979dbea-2f6b-4fb0-a28e-5b27753ca864","resolution":{"observed_at":"2026-08-05T17:03:21.941597Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.06173","last_updated":"2022-03-11T18:58:10Z","snapshot_observed_at":"2026-08-16T17:15:14.047305Z","submitted_at":"2022-03-11T18:58:10Z","title":"Masked Visual Pre-training for Motor Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.06173","snapshot_observed_at":"2026-08-05T17:03:21.407790Z","title":"Masked visual pre-training for motor control.arXiv preprint arXiv:2203.06173, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.17230","last_updated":"2025-09-06T14:24:21Z","snapshot_observed_at":"2026-08-14T16:39:29.021901Z","submitted_at":"2025-08-24T07:06:56Z","title":"4D Visual Pre-training for Robot Learning","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-05T17:03:21.407790Z"},"links":{"cited_paper":"/paper/2203.06173","citing_paper":"/paper/2508.17230"},"observation_digest":"sha256:d75eb47290704aefe759b6e9299be044e55838436dff11293c1261ff0598ec34","observation_id":"81782620-d8d6-45c8-8234-d84116b6eef8","resolution":{"observed_at":"2026-08-05T17:03:21.407790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:03:21.922788Z","title":"NeRFuser: Dif- fusion guided multi-task 3d policy learning, 2024","venue":null,"work_id":"ee4f42ab-4704-4ea0-9b1c-4877a93fce1a","year":2024},"citing_paper":{"arxiv_id":"2508.17230","last_updated":"2025-09-06T14:24:21Z","snapshot_observed_at":"2026-08-14T16:39:29.021901Z","submitted_at":"2025-08-24T07:06:56Z","title":"4D Visual Pre-training for Robot Learning","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-05T17:03:21.411478Z"},"links":{"citing_paper":"/paper/2508.17230"},"observation_digest":"sha256:96426fbb3c421dc0bb2b0b01893e2b0854d75717b58fe78229a65eded513ff11","observation_id":"d885646e-f68e-477c-8b69-0b544d592100","resolution":{"observed_at":"2026-08-05T17:03:21.927021Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01479","last_updated":"2024-10-29T17:49:41Z","snapshot_observed_at":"2026-08-16T13:38:02.409223Z","submitted_at":"2024-07-01T17:09:43Z","title":"EquiBot: SIM(3)-Equivariant Diffusion Policy for Generalizable and Data Efficient Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01479","snapshot_observed_at":"2026-08-05T17:03:21.415481Z","title":"Equibot: Sim (3)- equivariant diffusion policy for generalizable and data effi- cient learning.arXiv preprint arXiv:2407.01479, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.17230","last_updated":"2025-09-06T14:24:21Z","snapshot_observed_at":"2026-08-14T16:39:29.021901Z","submitted_at":"2025-08-24T07:06:56Z","title":"4D Visual Pre-training for Robot Learning","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-05T17:03:21.415481Z"},"links":{"cited_paper":"/paper/2407.01479","citing_paper":"/paper/2508.17230"},"observation_digest":"sha256:112f448798d52f0765de69de87ba54214c548e8815f784d81c3ed5315b7676c6","observation_id":"2e69c9c8-8ab2-4008-977c-30668a545c17","resolution":{"observed_at":"2026-08-05T17:03:21.415481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:03:21.419705Z","title":"Visual point cloud forecasting enables scalable autonomous driving","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.17230","last_updated":"2025-09-06T14:24:21Z","snapshot_observed_at":"2026-08-14T16:39:29.021901Z","submitted_at":"2025-08-24T07:06:56Z","title":"4D Visual Pre-training for Robot Learning","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-05T17:03:21.419705Z"},"links":{"citing_paper":"/paper/2508.17230"},"observation_digest":"sha256:742b2e0874f8ac23317031e14eec1143ac948a15a71f32d9fae08382b1079a2d","observation_id":"9b44c538-5c30-499b-bfec-bc31f1d38e88","resolution":{"observed_at":"2026-08-05T17:03:21.419705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:03:21.899843Z","title":"Meta- world: A benchmark and evaluation for multi-task and meta reinforcement learning","venue":null,"work_id":"14d9fc7b-5cca-4424-90ba-799c3b5fa47a","year":2020},"citing_paper":{"arxiv_id":"2508.17230","last_updated":"2025-09-06T14:24:21Z","snapshot_observed_at":"2026-08-14T16:39:29.021901Z","submitted_at":"2025-08-24T07:06:56Z","title":"4D Visual Pre-training for Robot Learning","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-05T17:03:21.423343Z"},"links":{"citing_paper":"/paper/2508.17230"},"observation_digest":"sha256:dfd5b37eee54d6e0877d729abeb88b232f92e87337217955116b69ef2da43eeb","observation_id":"d0832534-c200-4442-8c82-819a061c9a55","resolution":{"observed_at":"2026-08-05T17:03:21.904281Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:03:21.885844Z","title":"Visual reinforcement learning with self- supervised 3d representations.IEEE Robotics and Automa- tion Letters, 8(5):2890–2897, 2023","venue":null,"work_id":"a85785e8-c483-420c-994c-c2bb5bd3f885","year":2023},"citing_paper":{"arxiv_id":"2508.17230","last_updated":"2025-09-06T14:24:21Z","snapshot_observed_at":"2026-08-14T16:39:29.021901Z","submitted_at":"2025-08-24T07:06:56Z","title":"4D Visual Pre-training for Robot Learning","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-05T17:03:21.427088Z"},"links":{"citing_paper":"/paper/2508.17230"},"observation_digest":"sha256:cc03c4b82e1509fdc5a3b4b60b413c7995f9b74b8be1b035c1051c75cb671f07","observation_id":"417a6389-f1d0-460f-a1d6-f24e13ea1190","resolution":{"observed_at":"2026-08-05T17:03:21.890339Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:03:21.430762Z","title":"Gnfactor: Multi-task real robot learning with generalizable neural feature fields","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.17230","last_updated":"2025-09-06T14:24:21Z","snapshot_observed_at":"2026-08-14T16:39:29.021901Z","submitted_at":"2025-08-24T07:06:56Z","title":"4D Visual Pre-training for Robot Learning","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-05T17:03:21.430762Z"},"links":{"citing_paper":"/paper/2508.17230"},"observation_digest":"sha256:4ffcb0f730bb96c173e0a959cdf41e9f50d9fb60291269d345289a1e6356e1c2","observation_id":"7ea36b4e-021c-4441-a4fb-60df61569095","resolution":{"observed_at":"2026-08-05T17:03:21.430762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10803","last_updated":"2025-09-09T09:24:29Z","snapshot_observed_at":"2026-08-16T13:09:29.235048Z","submitted_at":"2024-10-14T17:59:00Z","title":"Generalizable Humanoid Manipulation with 3D Diffusion Policies","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10803","snapshot_observed_at":"2026-08-05T17:03:21.434778Z","title":"Generalizable humanoid manipulation with improved 3d diffusion policies","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.17230","last_updated":"2025-09-06T14:24:21Z","snapshot_observed_at":"2026-08-14T16:39:29.021901Z","submitted_at":"2025-08-24T07:06:56Z","title":"4D Visual Pre-training for Robot Learning","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-05T17:03:21.434778Z"},"links":{"cited_paper":"/paper/2410.10803","citing_paper":"/paper/2508.17230"},"observation_digest":"sha256:a41c18c2928525692abf5b23fff12f8cf84290eec2a2d7d895091d3cc8449508","observation_id":"1b55d1fb-3853-4c82-b410-47d256aa4e45","resolution":{"observed_at":"2026-08-05T17:03:21.434778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:03:21.863717Z","title":"3d diffusion policy: Gen- eralizable visuomotor policy learning via simple 3d repre- sentations","venue":null,"work_id":"7cbc4473-92e0-4558-9bff-f439e916a5fb","year":2024},"citing_paper":{"arxiv_id":"2508.17230","last_updated":"2025-09-06T14:24:21Z","snapshot_observed_at":"2026-08-14T16:39:29.021901Z","submitted_at":"2025-08-24T07:06:56Z","title":"4D Visual Pre-training for Robot Learning","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-05T17:03:21.439233Z"},"links":{"citing_paper":"/paper/2508.17230"},"observation_digest":"sha256:e44e37567aa14da7764aace5ef7f3471d71c5a1c03c8288b24852a60553d776a","observation_id":"4771448d-7443-4c28-ac4e-6864a87f1567","resolution":{"observed_at":"2026-08-05T17:03:21.867924Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:03:21.442925Z","title":"Point-m2ae: multi-scale masked autoencoders for hierarchical point cloud pre-training.Advances in neural information processing sys- tems, 35:27061–27074, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.17230","last_updated":"2025-09-06T14:24:21Z","snapshot_observed_at":"2026-08-14T16:39:29.021901Z","submitted_at":"2025-08-24T07:06:56Z","title":"4D Visual Pre-training for Robot Learning","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-05T17:03:21.442925Z"},"links":{"citing_paper":"/paper/2508.17230"},"observation_digest":"sha256:0e97721adb2a0d0f98e34022bb0b7fc38ee79c6424da4fd843c1b87b4535e2cb","observation_id":"4260ea29-7672-4d90-8b1c-6304b1696c41","resolution":{"observed_at":"2026-08-05T17:03:21.442925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.18194","last_updated":"2024-12-24T06:03:42Z","snapshot_observed_at":"2026-08-15T19:11:06.150955Z","submitted_at":"2024-12-24T06:03:42Z","title":"VLABench: A Large-Scale Benchmark for Language-Conditioned Robotics Manipulation with Long-Horizon Reasoning Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.18194","snapshot_observed_at":"2026-08-05T17:03:21.446755Z","title":"Vlabench: A large-scale benchmark for language-conditioned robotics manipulation with long- horizon reasoning tasks.arXiv preprint arXiv:2412.18194,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.17230","last_updated":"2025-09-06T14:24:21Z","snapshot_observed_at":"2026-08-14T16:39:29.021901Z","submitted_at":"2025-08-24T07:06:56Z","title":"4D Visual Pre-training for Robot Learning","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-05T17:03:21.446755Z"},"links":{"cited_paper":"/paper/2412.18194","citing_paper":"/paper/2508.17230"},"observation_digest":"sha256:002a58da495c15966fbd780f137e7c43d56ad47ce1e7b841ba6eb9c30a21357c","observation_id":"2d85b8e6-4ffb-4fe8-823f-1a8e01e82eb8","resolution":{"observed_at":"2026-08-05T17:03:21.446755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:03:21.842535Z","title":"Complete-to-partial 4d distillation for self-supervised point cloud sequence representation learning","venue":null,"work_id":"b515cc43-d794-42de-b7d9-a455b2a6902f","year":2023},"citing_paper":{"arxiv_id":"2508.17230","last_updated":"2025-09-06T14:24:21Z","snapshot_observed_at":"2026-08-14T16:39:29.021901Z","submitted_at":"2025-08-24T07:06:56Z","title":"4D Visual Pre-training for Robot Learning","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-05T17:03:21.451231Z"},"links":{"citing_paper":"/paper/2508.17230"},"observation_digest":"sha256:ff1cf004dd7c626996caf1f6ab5e3d45bbd1159efa18f59d11a9ecc0f40d9630","observation_id":"f6840b21-1ffe-46aa-8b0f-5fd9e948e0b5","resolution":{"observed_at":"2026-08-05T17:03:21.846631Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:03:21.829551Z","title":"Point transformer","venue":null,"work_id":"106853d1-8a21-4ffd-9ead-a6feb75d52c3","year":2021},"citing_paper":{"arxiv_id":"2508.17230","last_updated":"2025-09-06T14:24:21Z","snapshot_observed_at":"2026-08-14T16:39:29.021901Z","submitted_at":"2025-08-24T07:06:56Z","title":"4D Visual Pre-training for Robot Learning","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-05T17:03:21.454842Z"},"links":{"citing_paper":"/paper/2508.17230"},"observation_digest":"sha256:cec07118b5c4196282f12095962e4c47d973233ff10f6ed9d6c4e0f92d7ffc30","observation_id":"b6a15598-3cd3-4011-9959-ac5f20d1bb43","resolution":{"observed_at":"2026-08-05T17:03:21.833350Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.13705","last_updated":"2023-04-23T19:10:53Z","snapshot_observed_at":"2026-08-03T01:22:01.078078Z","submitted_at":"2023-04-23T19:10:53Z","title":"Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.13705","snapshot_observed_at":"2026-08-05T17:03:21.458999Z","title":"Learning fine-grained bimanual manipulation with low-cost hardware.arXiv preprint arXiv:2304.13705, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.17230","last_updated":"2025-09-06T14:24:21Z","snapshot_observed_at":"2026-08-14T16:39:29.021901Z","submitted_at":"2025-08-24T07:06:56Z","title":"4D Visual Pre-training for Robot Learning","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-05T17:03:21.458999Z"},"links":{"cited_paper":"/paper/2304.13705","citing_paper":"/paper/2508.17230"},"observation_digest":"sha256:217279bd8fa5c87149e06f10de9ff5e39a1ea55d6a82de855091449017ad3de3","observation_id":"e334a8fc-fadb-4334-90f8-de9692eb52d2","resolution":{"observed_at":"2026-08-05T17:03:21.458999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.14960","last_updated":"2023-11-25T08:10:05Z","snapshot_observed_at":"2026-08-16T14:40:29.043693Z","submitted_at":"2023-11-25T08:10:05Z","title":"Point Cloud Pre-training with Diffusion Models","version":1},"cited_work":{"arxiv_id":"2311.14960","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.14960","snapshot_observed_at":"2026-08-05T17:03:21.503184Z","title":"Point Cloud Pre-training with Diffusion Models","venue":"cs.CV","work_id":"804553c2-7f2f-4987-81eb-19f63014e9a3","year":2023},"citing_paper":{"arxiv_id":"2508.17230","last_updated":"2025-09-06T14:24:21Z","snapshot_observed_at":"2026-08-14T16:39:29.021901Z","submitted_at":"2025-08-24T07:06:56Z","title":"4D Visual Pre-training for Robot Learning","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-05T17:03:21.462860Z"},"links":{"cited_paper":"/paper/2311.14960","citing_paper":"/paper/2508.17230"},"observation_digest":"sha256:f13d34312a50b0c42e5a47aadc8b092fc0b3e47f29b709e91e9bd5aa7190f089","observation_id":"07fd99e0-d749-4779-88ba-ef697ffc9aea","resolution":{"observed_at":"2026-08-05T17:03:21.509768Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:03:21.815767Z","title":"3d shape generation and completion through point-voxel diffusion","venue":null,"work_id":"6fa54887-ad68-4a20-8462-1de66ee652c0","year":2021},"citing_paper":{"arxiv_id":"2508.17230","last_updated":"2025-09-06T14:24:21Z","snapshot_observed_at":"2026-08-14T16:39:29.021901Z","submitted_at":"2025-08-24T07:06:56Z","title":"4D Visual Pre-training for Robot Learning","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-05T17:03:21.467027Z"},"links":{"citing_paper":"/paper/2508.17230"},"observation_digest":"sha256:f20afaf101f6b7e0d39eef99a347ddb6ec25a9f02500c09de616bd8f5287eb58","observation_id":"6d5802aa-b5b4-439d-9860-80114dee874f","resolution":{"observed_at":"2026-08-05T17:03:21.820003Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2508.17230","last_updated":"2025-09-06T14:24:21Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-14T16:39:29.021901Z","submitted_at":"2025-08-24T07:06:56Z","title":"4D Visual Pre-training for Robot Learning"},"reference_resolution":{"displayed":64,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":30,"verified_exact":1,"verified_fuzzy":33},"total_outbound_references":64},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 64 of 64 outbound references and 1 inbound Pith citation observation for arXiv:2508.17230."}