{"as_of":"2026-08-08T17:40:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:24e0474f87a92546a96173141181c0f13669441ca532a6a725bae580c392e654","coverage":[{"denominator":64,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":64,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T04:37:23.418095Z","state":"measured"},{"denominator":64,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":64,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2602.04600/citation-record","integrity":"/paper/2602.04600/integrity","json":"/paper/2602.04600/citation-record.json","paper":"/paper/2602.04600"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:37:17.517283Z","title":"Structured solution methods for non-markovian decision processes","venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2602.04600","last_updated":"2026-07-10T13:11:24Z","snapshot_observed_at":"2026-08-06T22:16:31.922188Z","submitted_at":"2026-02-04T14:28:14Z","title":"Act, Sense, Act: Learning Active Perception from Large-Scale Egocentric Human Data","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T04:37:17.517283Z"},"links":{"citing_paper":"/paper/2602.04600"},"observation_digest":"sha256:9d9c32885044d6303a02c6a71117b7ba0d6008a11bfda0b9c767df135716c145","observation_id":"71fc61a6-cfe0-4658-9785-bb8cc8396087","resolution":{"observed_at":"2026-08-03T04:37:17.517283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-03T04:37:17.655839Z","title":"Qwen3-vl technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.04600","last_updated":"2026-07-10T13:11:24Z","snapshot_observed_at":"2026-08-06T22:16:31.922188Z","submitted_at":"2026-02-04T14:28:14Z","title":"Act, Sense, Act: Learning Active Perception from Large-Scale Egocentric Human Data","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-03T04:37:17.655839Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2602.04600"},"observation_digest":"sha256:d65bf70660e4cc1ee5f92ab0c745f5c660505b3d065108366d47669accd7cdc2","observation_id":"19b4b2cb-a4cc-4f11-b1b9-f826892306b0","resolution":{"observed_at":"2026-08-03T04:37:17.655839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:37:17.825726Z","title":"A markovian decision process.Journal of Mathematics and Mechanics, pages 679–684, 1957","venue":null,"work_id":null,"year":1957},"citing_paper":{"arxiv_id":"2602.04600","last_updated":"2026-07-10T13:11:24Z","snapshot_observed_at":"2026-08-06T22:16:31.922188Z","submitted_at":"2026-02-04T14:28:14Z","title":"Act, Sense, Act: Learning Active Perception from Large-Scale Egocentric Human Data","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-03T04:37:17.825726Z"},"links":{"citing_paper":"/paper/2602.04600"},"observation_digest":"sha256:3db6adfec97fdd1db1824ee3e8a23150e49b34ca04619614cf9bb290dc503569","observation_id":"f1fe87ff-7a38-411d-adfe-66e97ab33444","resolution":{"observed_at":"2026-08-03T04:37:17.825726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:37:17.900720Z","title":"Towards generalizable zero-shot manipulation via translating human interaction plans","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.04600","last_updated":"2026-07-10T13:11:24Z","snapshot_observed_at":"2026-08-06T22:16:31.922188Z","submitted_at":"2026-02-04T14:28:14Z","title":"Act, Sense, Act: Learning Active Perception from Large-Scale Egocentric Human Data","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T04:37:17.900720Z"},"links":{"citing_paper":"/paper/2602.04600"},"observation_digest":"sha256:398a10b7716afa3770a7244462827dd8ffbaeaa333d5be5a564b8f08a892931d","observation_id":"02a23a04-7276-4fb2-8afe-b23f682f3124","resolution":{"observed_at":"2026-08-03T04:37:17.900720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-03T04:37:17.972489Z","title":"arXiv preprint arXiv:2410.24164, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.04600","last_updated":"2026-07-10T13:11:24Z","snapshot_observed_at":"2026-08-06T22:16:31.922188Z","submitted_at":"2026-02-04T14:28:14Z","title":"Act, Sense, Act: Learning Active Perception from Large-Scale Egocentric Human Data","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T04:37:17.972489Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2602.04600"},"observation_digest":"sha256:f5a8a0427f3e51b68509c3bca11cdfe4eda1b9748a9c23df97ca353f51de3124","observation_id":"425fd73a-9115-4192-8653-b913083e7695","resolution":{"observed_at":"2026-08-03T04:37:17.972489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:37:18.042292Z","title":"In9th Annual Conference on Robot Learning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.04600","last_updated":"2026-07-10T13:11:24Z","snapshot_observed_at":"2026-08-06T22:16:31.922188Z","submitted_at":"2026-02-04T14:28:14Z","title":"Act, Sense, Act: Learning Active Perception from Large-Scale Egocentric Human Data","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T04:37:18.042292Z"},"links":{"citing_paper":"/paper/2602.04600"},"observation_digest":"sha256:89a880fe7c387b4b84bd3b6244613d4b20f8b0ae0500b8a3c5ce630502b43fad","observation_id":"4791f157-5940-4592-bae8-0a0874ee0c38","resolution":{"observed_at":"2026-08-03T04:37:18.042292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:37:18.117648Z","title":"Gennbv: Generalizable next-best-view policy for active 3d reconstruction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.04600","last_updated":"2026-07-10T13:11:24Z","snapshot_observed_at":"2026-08-06T22:16:31.922188Z","submitted_at":"2026-02-04T14:28:14Z","title":"Act, Sense, Act: Learning Active Perception from Large-Scale Egocentric Human Data","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T04:37:18.117648Z"},"links":{"citing_paper":"/paper/2602.04600"},"observation_digest":"sha256:353c373cb1cd90542faf1c2ab25fef5b037b7191434642c3846ed2bc342175bd","observation_id":"c0cbe983-00e5-4ecc-bf1b-bcdadc29493b","resolution":{"observed_at":"2026-08-03T04:37:18.117648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:37:18.185861Z","title":"Universal manipulation interface: In-the- wild robot teaching without in-the-wild robots","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.04600","last_updated":"2026-07-10T13:11:24Z","snapshot_observed_at":"2026-08-06T22:16:31.922188Z","submitted_at":"2026-02-04T14:28:14Z","title":"Act, Sense, Act: Learning Active Perception from Large-Scale Egocentric Human Data","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T04:37:18.185861Z"},"links":{"citing_paper":"/paper/2602.04600"},"observation_digest":"sha256:4982738b92194b837975ababeb48fd5f345b9b3793d406662e0144c25660f67e","observation_id":"bdc25a1f-6309-4bb5-ab07-a124a311f1bd","resolution":{"observed_at":"2026-08-03T04:37:18.185861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:37:18.260405Z","title":"Diffusion policy: Visuomotor policy learning via action diffusion.The International Journal of Robotics Research, 44(10-11):1684–1704, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.04600","last_updated":"2026-07-10T13:11:24Z","snapshot_observed_at":"2026-08-06T22:16:31.922188Z","submitted_at":"2026-02-04T14:28:14Z","title":"Act, Sense, Act: Learning Active Perception from Large-Scale Egocentric Human Data","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T04:37:18.260405Z"},"links":{"citing_paper":"/paper/2602.04600"},"observation_digest":"sha256:f6ce3b8eba757b99af38adde775363184ccf072d7c96e9b69c43c5a704a844a3","observation_id":"2fd5cd1a-abce-4289-87c3-f1eb1825cc2a","resolution":{"observed_at":"2026-08-03T04:37:18.260405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15833","last_updated":"2026-07-13T23:45:05Z","snapshot_observed_at":"2026-08-06T15:20:06.611013Z","submitted_at":"2025-07-21T17:44:10Z","title":"Look, Focus, Act: Efficient and Robust Robot Learning via Human Gaze and Foveated Vision Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.15833","snapshot_observed_at":"2026-08-03T04:37:18.332035Z","title":"Look, focus, act: Efficient and robust robot learning via human gaze and foveated vision transform- ers.arXiv preprint arXiv:2507.15833, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.04600","last_updated":"2026-07-10T13:11:24Z","snapshot_observed_at":"2026-08-06T22:16:31.922188Z","submitted_at":"2026-02-04T14:28:14Z","title":"Act, Sense, Act: Learning Active Perception from Large-Scale Egocentric Human Data","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T04:37:18.332035Z"},"links":{"cited_paper":"/paper/2507.15833","citing_paper":"/paper/2602.04600"},"observation_digest":"sha256:f6d0b6374516c21e3d4cc0034c808688da67dacca58af7f479d5817b35d75222","observation_id":"400d48b8-c366-4ddf-b290-5bc82097a836","resolution":{"observed_at":"2026-08-03T04:37:18.332035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:37:18.409027Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.04600","last_updated":"2026-07-10T13:11:24Z","snapshot_observed_at":"2026-08-06T22:16:31.922188Z","submitted_at":"2026-02-04T14:28:14Z","title":"Act, Sense, Act: Learning Active Perception from Large-Scale Egocentric Human Data","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T04:37:18.409027Z"},"links":{"citing_paper":"/paper/2602.04600"},"observation_digest":"sha256:d6cd2ea65eed7274bcd0b845b9cf31d73e1c0f53066f385fae0a039737f2c949","observation_id":"4addb80a-d7b8-4d9e-be04-349c709f54cc","resolution":{"observed_at":"2026-08-03T04:37:18.409027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:37:18.480792Z","title":"Ego-exo4d: Understanding skilled human activity from first-and third-person perspectives","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.04600","last_updated":"2026-07-10T13:11:24Z","snapshot_observed_at":"2026-08-06T22:16:31.922188Z","submitted_at":"2026-02-04T14:28:14Z","title":"Act, Sense, Act: Learning Active Perception from Large-Scale Egocentric Human Data","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T04:37:18.480792Z"},"links":{"citing_paper":"/paper/2602.04600"},"observation_digest":"sha256:6abccca98ea97de1ac619b430f9625a142c2ba897d2478e7636c462417b47efc","observation_id":"b4bf6e4d-e3ec-43b9-8728-908e84631b63","resolution":{"observed_at":"2026-08-03T04:37:18.480792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:37:18.558167Z","title":"Macarons: Mapping and coverage antic- ipation with rgb online self-supervision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.04600","last_updated":"2026-07-10T13:11:24Z","snapshot_observed_at":"2026-08-06T22:16:31.922188Z","submitted_at":"2026-02-04T14:28:14Z","title":"Act, Sense, Act: Learning Active Perception from Large-Scale Egocentric Human Data","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T04:37:18.558167Z"},"links":{"citing_paper":"/paper/2602.04600"},"observation_digest":"sha256:0c27ae51abe6fca7d327791f840f8dc905c0b879ae7155cb409d9a501b168d76","observation_id":"4b3277a2-735d-47e5-80fd-cdca68238d0d","resolution":{"observed_at":"2026-08-03T04:37:18.558167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09320","last_updated":"2025-07-01T22:27:41Z","snapshot_observed_at":"2026-08-07T17:10:16.162916Z","submitted_at":"2025-03-12T12:12:07Z","title":"2HandedAfforder: Learning Precise Actionable Bimanual Affordances from Human Videos","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.09320","snapshot_observed_at":"2026-08-03T04:37:18.627732Z","title":"2handedafforder: Learning precise actionable bimanual affordances from human videos","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.04600","last_updated":"2026-07-10T13:11:24Z","snapshot_observed_at":"2026-08-06T22:16:31.922188Z","submitted_at":"2026-02-04T14:28:14Z","title":"Act, Sense, Act: Learning Active Perception from Large-Scale Egocentric Human Data","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T04:37:18.627732Z"},"links":{"cited_paper":"/paper/2503.09320","citing_paper":"/paper/2602.04600"},"observation_digest":"sha256:5ff98104768639b556ca4cccfb128df76224302b7a8fa3701ecc9804c6d90426","observation_id":"abba8668-7892-4ff1-8cf1-e46feaea7da3","resolution":{"observed_at":"2026-08-03T04:37:18.627732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:37:18.698392Z","title":"6d rotation representation for unconstrained head pose estimation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.04600","last_updated":"2026-07-10T13:11:24Z","snapshot_observed_at":"2026-08-06T22:16:31.922188Z","submitted_at":"2026-02-04T14:28:14Z","title":"Act, Sense, Act: Learning Active Perception from Large-Scale Egocentric Human Data","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T04:37:18.698392Z"},"links":{"citing_paper":"/paper/2602.04600"},"observation_digest":"sha256:46d2dde1cde75d690ccad529a493b515504dd6281dff57b0912baa03f16b61fb","observation_id":"19cbd413-e839-4880-9d3f-5e17a267a98f","resolution":{"observed_at":"2026-08-03T04:37:18.698392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.11709","last_updated":"2026-03-09T06:44:42Z","snapshot_observed_at":"2026-07-06T21:25:23.371749Z","submitted_at":"2025-05-16T21:34:47Z","title":"EgoDex: Learning Dexterous Manipulation from Large-Scale Egocentric Video","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.11709","snapshot_observed_at":"2026-08-03T04:37:18.782885Z","title":"Egodex: Learning dexterous manipulation from large-scale egocentric video.arXiv preprint arXiv:2505.11709, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.04600","last_updated":"2026-07-10T13:11:24Z","snapshot_observed_at":"2026-08-06T22:16:31.922188Z","submitted_at":"2026-02-04T14:28:14Z","title":"Act, Sense, Act: Learning Active Perception from Large-Scale Egocentric Human Data","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T04:37:18.782885Z"},"links":{"cited_paper":"/paper/2505.11709","citing_paper":"/paper/2602.04600"},"observation_digest":"sha256:e85cfa22ce13aad54bb6a0553f952ccfd4f1e1a2ad11e7f59d834b180a6d7fb9","observation_id":"a8868160-a769-453b-8cef-9a23136492e3","resolution":{"observed_at":"2026-08-03T04:37:18.782885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:37:18.848516Z","title":"Egomimic: Scaling imitation learning via egocentric video","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.04600","last_updated":"2026-07-10T13:11:24Z","snapshot_observed_at":"2026-08-06T22:16:31.922188Z","submitted_at":"2026-02-04T14:28:14Z","title":"Act, Sense, Act: Learning Active Perception from Large-Scale Egocentric Human Data","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T04:37:18.848516Z"},"links":{"citing_paper":"/paper/2602.04600"},"observation_digest":"sha256:6767b28cf3937fbb0237e28b206d15b277fb4e59cb3b4ec53a82401157b807d1","observation_id":"acd1401d-e1bc-4c25-ba97-b4d1e83f85af","resolution":{"observed_at":"2026-08-03T04:37:18.848516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:37:18.932435Z","title":"Multi-task real-robot data with gaze attention for dual-arm fine manipulation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.04600","last_updated":"2026-07-10T13:11:24Z","snapshot_observed_at":"2026-08-06T22:16:31.922188Z","submitted_at":"2026-02-04T14:28:14Z","title":"Act, Sense, Act: Learning Active Perception from Large-Scale Egocentric Human Data","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T04:37:18.932435Z"},"links":{"citing_paper":"/paper/2602.04600"},"observation_digest":"sha256:55eabce32c4ec8fd3a30408caa2aec995aac18d4708879dbf8ba2c3ef984e193","observation_id":"76fde251-2984-47ea-8fb0-6a1bb4114872","resolution":{"observed_at":"2026-08-03T04:37:18.932435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-03T04:37:19.026228Z","title":"Openvla: An open-source vision-language-action model.arXiv preprint arXiv:2406.09246, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.04600","last_updated":"2026-07-10T13:11:24Z","snapshot_observed_at":"2026-08-06T22:16:31.922188Z","submitted_at":"2026-02-04T14:28:14Z","title":"Act, Sense, Act: Learning Active Perception from Large-Scale Egocentric Human Data","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T04:37:19.026228Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2602.04600"},"observation_digest":"sha256:f53e2275db14a0aba1f7e19b6737066e69e888746d6a0d811ac3977053ebf03b","observation_id":"8ba4b6bf-80fb-46ca-a6e5-b4bdbefd762d","resolution":{"observed_at":"2026-08-03T04:37:19.026228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19645","last_updated":"2025-04-28T07:49:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-27T00:30:29Z","title":"Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.19645","snapshot_observed_at":"2026-08-03T04:37:19.101080Z","title":"Fine- tuning vision-language-action models: Optimizing speed and success.arXiv preprint arXiv:2502.19645, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.04600","last_updated":"2026-07-10T13:11:24Z","snapshot_observed_at":"2026-08-06T22:16:31.922188Z","submitted_at":"2026-02-04T14:28:14Z","title":"Act, Sense, Act: Learning Active Perception from Large-Scale Egocentric Human Data","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-03T04:37:19.101080Z"},"links":{"cited_paper":"/paper/2502.19645","citing_paper":"/paper/2602.04600"},"observation_digest":"sha256:afe2571c539691e0b63c38c84bf8d3958bd65566831e4f029cce92409709a5bc","observation_id":"d6fbceb8-3803-4a9c-aacc-3c7a2c26668f","resolution":{"observed_at":"2026-08-03T04:37:19.101080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:37:19.190403Z","title":"Aria gen 2 pilot dataset.arXiv preprint arXiv:2510.16134, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.04600","last_updated":"2026-07-10T13:11:24Z","snapshot_observed_at":"2026-08-06T22:16:31.922188Z","submitted_at":"2026-02-04T14:28:14Z","title":"Act, Sense, Act: Learning Active Perception from Large-Scale Egocentric Human Data","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T04:37:19.190403Z"},"links":{"citing_paper":"/paper/2602.04600"},"observation_digest":"sha256:e4d139f4f679eeae14d6d4479ae3caf47af07d8d851e8c93e106472f188fa488","observation_id":"0f513a91-4daa-4f7b-abf3-22a53b721853","resolution":{"observed_at":"2026-08-03T04:37:19.190403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:37:19.244648Z","title":"Scalable vision-language-action model pretraining for robotic manipulation with real-life human activity videos.arXiv preprint arXiv:2510.21571, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.04600","last_updated":"2026-07-10T13:11:24Z","snapshot_observed_at":"2026-08-06T22:16:31.922188Z","submitted_at":"2026-02-04T14:28:14Z","title":"Act, Sense, Act: Learning Active Perception from Large-Scale Egocentric Human Data","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T04:37:19.244648Z"},"links":{"citing_paper":"/paper/2602.04600"},"observation_digest":"sha256:22e4fe34be2c97c0545b7bfc653ed80d7b603ad26796216faac997627dd85de4","observation_id":"c27ab4a9-65e8-4d1d-9052-677c7ef1f17f","resolution":{"observed_at":"2026-08-03T04:37:19.244648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:37:19.353014Z","title":"Focal loss for dense object detection","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2602.04600","last_updated":"2026-07-10T13:11:24Z","snapshot_observed_at":"2026-08-06T22:16:31.922188Z","submitted_at":"2026-02-04T14:28:14Z","title":"Act, Sense, Act: Learning Active Perception from Large-Scale Egocentric Human Data","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T04:37:19.353014Z"},"links":{"citing_paper":"/paper/2602.04600"},"observation_digest":"sha256:3b88a281cd96a74e9a26d0364941a8f29e73cf4a00e6c591593bb42ee7ff9adf","observation_id":"510db54d-c736-4530-a17d-3056979bbe0e","resolution":{"observed_at":"2026-08-03T04:37:19.353014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:37:19.462100Z","title":"Hoi4d: A 4d egocentric dataset for category- level human-object interaction","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.04600","last_updated":"2026-07-10T13:11:24Z","snapshot_observed_at":"2026-08-06T22:16:31.922188Z","submitted_at":"2026-02-04T14:28:14Z","title":"Act, Sense, Act: Learning Active Perception from Large-Scale Egocentric Human Data","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T04:37:19.462100Z"},"links":{"citing_paper":"/paper/2602.04600"},"observation_digest":"sha256:239256e22a6e6e482853b7f89fa19bd27cd127a5c9d33ce66cb230482fde52d7","observation_id":"d0322090-2a6f-459c-b1b9-07e14161da5d","resolution":{"observed_at":"2026-08-03T04:37:19.462100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:37:19.571911Z","title":"Vip: Towards universal visual reward and representation via value-implicit pre-training","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.04600","last_updated":"2026-07-10T13:11:24Z","snapshot_observed_at":"2026-08-06T22:16:31.922188Z","submitted_at":"2026-02-04T14:28:14Z","title":"Act, Sense, Act: Learning Active Perception from Large-Scale Egocentric Human Data","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-03T04:37:19.571911Z"},"links":{"citing_paper":"/paper/2602.04600"},"observation_digest":"sha256:d689496da7e8d450c5680b149abead6011394da12671171c5f4da3e3824dbcf7","observation_id":"25b25f49-c46a-4f44-bb28-d9a95ff5bc11","resolution":{"observed_at":"2026-08-03T04:37:19.571911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:37:19.696017Z","title":"Aria glasses,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.04600","last_updated":"2026-07-10T13:11:24Z","snapshot_observed_at":"2026-08-06T22:16:31.922188Z","submitted_at":"2026-02-04T14:28:14Z","title":"Act, Sense, Act: Learning Active Perception from Large-Scale Egocentric Human Data","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-03T04:37:19.696017Z"},"links":{"citing_paper":"/paper/2602.04600"},"observation_digest":"sha256:88b9b3a280f748e71a0f401bab95ce8a880e6b9c6970a329a1cead22fbac5657","observation_id":"d03da727-fbbd-485d-923e-1a26a07aa847","resolution":{"observed_at":"2026-08-03T04:37:19.696017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:37:19.844833Z","title":"Quest 3,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.04600","last_updated":"2026-07-10T13:11:24Z","snapshot_observed_at":"2026-08-06T22:16:31.922188Z","submitted_at":"2026-02-04T14:28:14Z","title":"Act, Sense, Act: Learning Active Perception from Large-Scale Egocentric Human Data","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-03T04:37:19.844833Z"},"links":{"citing_paper":"/paper/2602.04600"},"observation_digest":"sha256:a7a629e244def58b56836d5b97e2eea42d4d4915ae464b5f991512b25255eb9d","observation_id":"2808ffa0-eb46-42b2-8a6e-63a3781dbb00","resolution":{"observed_at":"2026-08-03T04:37:19.844833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:37:19.917159Z","title":"Hololens","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.04600","last_updated":"2026-07-10T13:11:24Z","snapshot_observed_at":"2026-08-06T22:16:31.922188Z","submitted_at":"2026-02-04T14:28:14Z","title":"Act, Sense, Act: Learning Active Perception from Large-Scale Egocentric Human Data","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-03T04:37:19.917159Z"},"links":{"citing_paper":"/paper/2602.04600"},"observation_digest":"sha256:6a0d14c64cee9160487e710b732522c5716cc1178421519336b3fd4f7ab2b8a9","observation_id":"0a4fdab8-de7d-45ee-8fa5-1aeb01ba3023","resolution":{"observed_at":"2026-08-03T04:37:19.917159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:37:19.983595Z","title":"Captaincook4d: A dataset for understanding errors in procedural activities.Advances in Neural Information Processing Systems, 37:135626–135679, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.04600","last_updated":"2026-07-10T13:11:24Z","snapshot_observed_at":"2026-08-06T22:16:31.922188Z","submitted_at":"2026-02-04T14:28:14Z","title":"Act, Sense, Act: Learning Active Perception from Large-Scale Egocentric Human Data","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-03T04:37:19.983595Z"},"links":{"citing_paper":"/paper/2602.04600"},"observation_digest":"sha256:2d597bf74d88cff9d2aa71c5f14f979535f7e2deef089f3aaadddaf3e0fe799d","observation_id":"991f4b37-cd50-4713-8f3b-00361df0f619","resolution":{"observed_at":"2026-08-03T04:37:19.983595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:37:20.051271Z","title":"A backpack full of skills: Egocentric video understanding with diverse task per- spectives","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.04600","last_updated":"2026-07-10T13:11:24Z","snapshot_observed_at":"2026-08-06T22:16:31.922188Z","submitted_at":"2026-02-04T14:28:14Z","title":"Act, Sense, Act: Learning Active Perception from Large-Scale Egocentric Human Data","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-03T04:37:20.051271Z"},"links":{"citing_paper":"/paper/2602.04600"},"observation_digest":"sha256:99a041d94e06babff0a2188b92803e06772d770216458e20d7348c72aae38d63","observation_id":"47ea6115-1417-4559-b047-2d3e74b09cf4","resolution":{"observed_at":"2026-08-03T04:37:20.051271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:37:20.151703Z","title":"Hd-epic: A highly-detailed egocentric video dataset","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.04600","last_updated":"2026-07-10T13:11:24Z","snapshot_observed_at":"2026-08-06T22:16:31.922188Z","submitted_at":"2026-02-04T14:28:14Z","title":"Act, Sense, Act: Learning Active Perception from Large-Scale Egocentric Human Data","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-03T04:37:20.151703Z"},"links":{"citing_paper":"/paper/2602.04600"},"observation_digest":"sha256:c6c9957b267038b3f6bdfbc9fb4cc14010b7f4d7af8eb7b6522bf2a1608b16be","observation_id":"423df962-0ae8-43c8-ad82-e88915e96d17","resolution":{"observed_at":"2026-08-03T04:37:20.151703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:37:20.256135Z","title":"Egobridge: Domain adaptation for generalizable imitation from egocentric human data","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.04600","last_updated":"2026-07-10T13:11:24Z","snapshot_observed_at":"2026-08-06T22:16:31.922188Z","submitted_at":"2026-02-04T14:28:14Z","title":"Act, Sense, Act: Learning Active Perception from Large-Scale Egocentric Human Data","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-03T04:37:20.256135Z"},"links":{"citing_paper":"/paper/2602.04600"},"observation_digest":"sha256:ffa800a76c3f13e2e1167dff2cd6812e8247b53eff1023e90e5837bdd0d59e80","observation_id":"c1e48a58-dcbe-4a90-a459-561cb0b503b9","resolution":{"observed_at":"2026-08-03T04:37:20.256135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:37:20.354208Z","title":"Humanoid policy˜ human policy.arXiv preprint arXiv:2503.13441, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.04600","last_updated":"2026-07-10T13:11:24Z","snapshot_observed_at":"2026-08-06T22:16:31.922188Z","submitted_at":"2026-02-04T14:28:14Z","title":"Act, Sense, Act: Learning Active Perception from Large-Scale Egocentric Human Data","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-03T04:37:20.354208Z"},"links":{"citing_paper":"/paper/2602.04600"},"observation_digest":"sha256:1d1e8f7baa81e2e1cae1e04fb942c4fe2da0ec6e31962dad341c6dae80c5d149","observation_id":"45f526e8-c160-4e6f-a046-bfcab62dcc2c","resolution":{"observed_at":"2026-08-03T04:37:20.354208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:37:20.464051Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2602.04600","last_updated":"2026-07-10T13:11:24Z","snapshot_observed_at":"2026-08-06T22:16:31.922188Z","submitted_at":"2026-02-04T14:28:14Z","title":"Act, Sense, Act: Learning Active Perception from Large-Scale Egocentric Human Data","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-03T04:37:20.464051Z"},"links":{"citing_paper":"/paper/2602.04600"},"observation_digest":"sha256:074ea3f7e1863744e6a6041390ce8f8b40e6456b8905942025e4935420c6388c","observation_id":"1358be3d-5b67-474f-a2b3-eaee6470295e","resolution":{"observed_at":"2026-08-03T04:37:20.464051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.15071","last_updated":"2025-02-27T03:41:27Z","snapshot_observed_at":"2026-08-04T13:19:42.939126Z","submitted_at":"2025-01-25T04:33:43Z","title":"Gaze-Guided Task Decomposition for Imitation Learning in Robotic Manipulation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.15071","snapshot_observed_at":"2026-08-03T04:37:20.532506Z","title":"Gaze-guided task decomposition for imitation learning in robotic manipulation.arXiv preprint arXiv:2501.15071, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.04600","last_updated":"2026-07-10T13:11:24Z","snapshot_observed_at":"2026-08-06T22:16:31.922188Z","submitted_at":"2026-02-04T14:28:14Z","title":"Act, Sense, Act: Learning Active Perception from Large-Scale Egocentric Human Data","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-03T04:37:20.532506Z"},"links":{"cited_paper":"/paper/2501.15071","citing_paper":"/paper/2602.04600"},"observation_digest":"sha256:5691b12157d0e126c8589e95662834bac730e5c14e617bf1583ff992976ec58b","observation_id":"426c23b1-c255-452c-bfb1-cd5d4976dcd5","resolution":{"observed_at":"2026-08-03T04:37:20.532506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:37:20.600815Z","title":"Agrl: Affordance-guided reinforce- ment learning from human video","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.04600","last_updated":"2026-07-10T13:11:24Z","snapshot_observed_at":"2026-08-06T22:16:31.922188Z","submitted_at":"2026-02-04T14:28:14Z","title":"Act, Sense, Act: Learning Active Perception from Large-Scale Egocentric Human Data","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-03T04:37:20.600815Z"},"links":{"citing_paper":"/paper/2602.04600"},"observation_digest":"sha256:0f2a367655ce30adabc3897c20382f26cbec05f6d163c97341f77b25138a6b13","observation_id":"a5209964-769e-443f-857d-ccaf0d978ea7","resolution":{"observed_at":"2026-08-03T04:37:20.600815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07788","last_updated":"2024-07-04T04:35:04Z","snapshot_observed_at":"2026-07-06T17:43:22.965126Z","submitted_at":"2024-03-12T16:23:49Z","title":"DexCap: Scalable and Portable Mocap Data Collection System for Dexterous Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.07788","snapshot_observed_at":"2026-08-03T04:37:20.701086Z","title":"Dexcap: Scalable and portable mocap data collection system for dexterous manipulation.arXiv preprint arXiv:2403.07788, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.04600","last_updated":"2026-07-10T13:11:24Z","snapshot_observed_at":"2026-08-06T22:16:31.922188Z","submitted_at":"2026-02-04T14:28:14Z","title":"Act, Sense, Act: Learning Active Perception from Large-Scale Egocentric Human Data","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-03T04:37:20.701086Z"},"links":{"cited_paper":"/paper/2403.07788","citing_paper":"/paper/2602.04600"},"observation_digest":"sha256:2a8de1a2dc8cca301811f95010c765b88f71d3bc60eaca36b117f08d33bd0db4","observation_id":"9890cb91-66d3-4ce4-b8cb-983d16674e4a","resolution":{"observed_at":"2026-08-03T04:37:20.701086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:37:20.807167Z","title":"Observe then act: Asynchronous active vision-action model for robotic manipulation.IEEE Robotics and Automation Letters, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.04600","last_updated":"2026-07-10T13:11:24Z","snapshot_observed_at":"2026-08-06T22:16:31.922188Z","submitted_at":"2026-02-04T14:28:14Z","title":"Act, Sense, Act: Learning Active Perception from Large-Scale Egocentric Human Data","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-03T04:37:20.807167Z"},"links":{"citing_paper":"/paper/2602.04600"},"observation_digest":"sha256:1f3499415adc12aa6622a3bb559032734cceb4fb350df3fc3d3f2bcd5baffca3","observation_id":"afe15cf2-195e-4e2b-b5b7-3c29151a03ff","resolution":{"observed_at":"2026-08-03T04:37:20.807167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:37:20.883470Z","title":"Graspview: Active perception scoring and best-view optimization for robotic grasping in cluttered environments.arXiv preprint arXiv:2511.04199, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.04600","last_updated":"2026-07-10T13:11:24Z","snapshot_observed_at":"2026-08-06T22:16:31.922188Z","submitted_at":"2026-02-04T14:28:14Z","title":"Act, Sense, Act: Learning Active Perception from Large-Scale Egocentric Human Data","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-03T04:37:20.883470Z"},"links":{"citing_paper":"/paper/2602.04600"},"observation_digest":"sha256:703e5d4c178cf2d452bf70724387b278d91a3ffde86754e3d7e56ed5e26cc052","observation_id":"29b7623f-a86e-4b96-9827-30eaabca3f02","resolution":{"observed_at":"2026-08-03T04:37:20.883470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.19026","last_updated":"2024-08-07T05:54:04Z","snapshot_observed_at":"2026-08-06T11:06:44.227248Z","submitted_at":"2024-03-27T21:43:12Z","title":"EgoNav: Egocentric Scene-aware Human Trajectory Prediction","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.19026","snapshot_observed_at":"2026-08-03T04:37:20.946439Z","title":"Egonav: Egocentric scene-aware human trajectory pre- diction.arXiv preprint arXiv:2403.19026, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.04600","last_updated":"2026-07-10T13:11:24Z","snapshot_observed_at":"2026-08-06T22:16:31.922188Z","submitted_at":"2026-02-04T14:28:14Z","title":"Act, Sense, Act: Learning Active Perception from Large-Scale Egocentric Human Data","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-03T04:37:20.946439Z"},"links":{"cited_paper":"/paper/2403.19026","citing_paper":"/paper/2602.04600"},"observation_digest":"sha256:a788fe33cedce3fe702687a1efc1c227bc025997cd2a9fcfdcad35d2ead9a9fe","observation_id":"71d68b78-a520-4c95-bedf-c302f79d51a7","resolution":{"observed_at":"2026-08-03T04:37:20.946439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:37:21.039408Z","title":"Observer actor: Active vision imitation learning with sparse view gaussian splatting.arXiv preprint arXiv:2511.18140, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.04600","last_updated":"2026-07-10T13:11:24Z","snapshot_observed_at":"2026-08-06T22:16:31.922188Z","submitted_at":"2026-02-04T14:28:14Z","title":"Act, Sense, Act: Learning Active Perception from Large-Scale Egocentric Human Data","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-03T04:37:21.039408Z"},"links":{"citing_paper":"/paper/2602.04600"},"observation_digest":"sha256:85201b41232eed71870b64ddd755c97818aa8d4187df644599aae84938dc3759","observation_id":"3071b74f-19c2-417c-8583-35115ab385cb","resolution":{"observed_at":"2026-08-03T04:37:21.039408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:37:21.137434Z","title":"Mean squared error: Love it or leave it? a new look at signal fidelity measures.IEEE signal processing magazine, 26(1):98–117, 2009","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2602.04600","last_updated":"2026-07-10T13:11:24Z","snapshot_observed_at":"2026-08-06T22:16:31.922188Z","submitted_at":"2026-02-04T14:28:14Z","title":"Act, Sense, Act: Learning Active Perception from Large-Scale Egocentric Human Data","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-03T04:37:21.137434Z"},"links":{"citing_paper":"/paper/2602.04600"},"observation_digest":"sha256:9ce2115555f35b535d2a9899b641a91e522f490c566dfa2a3383ad8898c8ebbb","observation_id":"825db8ff-ac30-41f3-910b-102ec99f4468","resolution":{"observed_at":"2026-08-03T04:37:21.137434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.15666","last_updated":"2025-06-18T17:43:55Z","snapshot_observed_at":"2026-08-06T23:49:29.228821Z","submitted_at":"2025-06-18T17:43:55Z","title":"Vision in Action: Learning Active Perception from Human Demonstrations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.15666","snapshot_observed_at":"2026-08-03T04:37:21.213552Z","title":"Vision in action: Learning active perception from human demonstrations","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.04600","last_updated":"2026-07-10T13:11:24Z","snapshot_observed_at":"2026-08-06T22:16:31.922188Z","submitted_at":"2026-02-04T14:28:14Z","title":"Act, Sense, Act: Learning Active Perception from Large-Scale Egocentric Human Data","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-03T04:37:21.213552Z"},"links":{"cited_paper":"/paper/2506.15666","citing_paper":"/paper/2602.04600"},"observation_digest":"sha256:3ef78853df0a2eb07bdaac07ba4e8f3ce7ed8b385dfd6eb69406850fc590d101","observation_id":"75ac2149-2037-4053-84b8-685da97bd976","resolution":{"observed_at":"2026-08-03T04:37:21.213552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:37:21.286316Z","title":"Understanding and improving layer normalization.Advances in neural information process- ing systems, 32, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2602.04600","last_updated":"2026-07-10T13:11:24Z","snapshot_observed_at":"2026-08-06T22:16:31.922188Z","submitted_at":"2026-02-04T14:28:14Z","title":"Act, Sense, Act: Learning Active Perception from Large-Scale Egocentric Human Data","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-03T04:37:21.286316Z"},"links":{"citing_paper":"/paper/2602.04600"},"observation_digest":"sha256:e09c2b1af4b5fd133642eaa646041b8a7ba2a5f236b2b89bbd0000b089e75d42","observation_id":"1e156a47-4edd-4c75-9e98-228e1dee4024","resolution":{"observed_at":"2026-08-03T04:37:21.286316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:37:21.382612Z","title":"Dexumi: Using human hand as the universal manipulation in- terface for dexterous manipulation.arXiv preprint arXiv:2505.21864, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.04600","last_updated":"2026-07-10T13:11:24Z","snapshot_observed_at":"2026-08-06T22:16:31.922188Z","submitted_at":"2026-02-04T14:28:14Z","title":"Act, Sense, Act: Learning Active Perception from Large-Scale Egocentric Human Data","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-03T04:37:21.382612Z"},"links":{"citing_paper":"/paper/2602.04600"},"observation_digest":"sha256:fb8a29175ccd6b09737dca74948976ee73f98853d7ac36c17d8b9ea0212763ba","observation_id":"8868a9ce-1398-4906-984a-cdf0d19a71c4","resolution":{"observed_at":"2026-08-03T04:37:21.382612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:37:21.580769Z","title":"VUER: An event-driven, declarative visu- alization toolkit for genai and robotics, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.04600","last_updated":"2026-07-10T13:11:24Z","snapshot_observed_at":"2026-08-06T22:16:31.922188Z","submitted_at":"2026-02-04T14:28:14Z","title":"Act, Sense, Act: Learning Active Perception from Large-Scale Egocentric Human Data","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-03T04:37:21.580769Z"},"links":{"citing_paper":"/paper/2602.04600"},"observation_digest":"sha256:c6d5725b9a4c409990be7a06e88116da0901d26775700758977cd163e2845792","observation_id":"6e0ea11e-36d8-44d8-9245-cbfa10bfe506","resolution":{"observed_at":"2026-08-03T04:37:21.580769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:37:21.715470Z","title":"Egomi: Learning active vision and whole-body manipulation from egocentric human demonstrations.arXiv preprint arXiv:2511.00153, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.04600","last_updated":"2026-07-10T13:11:24Z","snapshot_observed_at":"2026-08-06T22:16:31.922188Z","submitted_at":"2026-02-04T14:28:14Z","title":"Act, Sense, Act: Learning Active Perception from Large-Scale Egocentric Human Data","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-03T04:37:21.715470Z"},"links":{"citing_paper":"/paper/2602.04600"},"observation_digest":"sha256:abd8fa9925fff6e05f4f77ca268a654b32bd0ba1ac9e99a039f96ead1fd2bcf3","observation_id":"180ec439-e98f-4387-ae51-5742a7970352","resolution":{"observed_at":"2026-08-03T04:37:21.715470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:37:21.837073Z","title":"Activeumi: Robotic manipulation with active perception from robot-free human demonstrations.arXiv preprint arXiv:2510.01607, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.04600","last_updated":"2026-07-10T13:11:24Z","snapshot_observed_at":"2026-08-06T22:16:31.922188Z","submitted_at":"2026-02-04T14:28:14Z","title":"Act, Sense, Act: Learning Active Perception from Large-Scale Egocentric Human Data","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-03T04:37:21.837073Z"},"links":{"citing_paper":"/paper/2602.04600"},"observation_digest":"sha256:96cdb46318fd6287082e2dc5ffb22e64af01acc18d3df2949478a552288be760","observation_id":"a3e8c88e-5870-4a33-b2c2-aae3ac18f686","resolution":{"observed_at":"2026-08-03T04:37:21.837073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.13705","last_updated":"2023-04-23T19:10:53Z","snapshot_observed_at":"2026-08-03T01:22:01.078078Z","submitted_at":"2023-04-23T19:10:53Z","title":"Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.13705","snapshot_observed_at":"2026-08-03T04:37:21.931495Z","title":"Learning fine-grained bimanual manipulation with low-cost hardware.arXiv preprint arXiv:2304.13705, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.04600","last_updated":"2026-07-10T13:11:24Z","snapshot_observed_at":"2026-08-06T22:16:31.922188Z","submitted_at":"2026-02-04T14:28:14Z","title":"Act, Sense, Act: Learning Active Perception from Large-Scale Egocentric Human Data","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-03T04:37:21.931495Z"},"links":{"cited_paper":"/paper/2304.13705","citing_paper":"/paper/2602.04600"},"observation_digest":"sha256:ad11ce0a4db85bb72decde2b5c7578a1ba16f53988d7cc621cba6e09d082d47e","observation_id":"0e8a60ba-28ce-4c05-9fbe-facb88cab8a2","resolution":{"observed_at":"2026-08-03T04:37:21.931495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:37:22.028769Z","title":"Emma: Scaling mobile manipulation via egocentric human data.arXiv preprint arXiv:2509.04443, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.04600","last_updated":"2026-07-10T13:11:24Z","snapshot_observed_at":"2026-08-06T22:16:31.922188Z","submitted_at":"2026-02-04T14:28:14Z","title":"Act, Sense, Act: Learning Active Perception from Large-Scale Egocentric Human Data","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-03T04:37:22.028769Z"},"links":{"citing_paper":"/paper/2602.04600"},"observation_digest":"sha256:dee0d54af492b08bdd674735958da68daa2ce56d52b715657c5605347e706c16","observation_id":"7c802b7f-14b0-4699-bc9e-601277cd995d","resolution":{"observed_at":"2026-08-03T04:37:22.028769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20321","last_updated":"2025-09-04T08:23:37Z","snapshot_observed_at":"2026-08-07T22:46:10.482452Z","submitted_at":"2024-05-30T17:56:54Z","title":"Vision-based Manipulation from Single Human Video with Open-World Object Graphs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20321","snapshot_observed_at":"2026-08-03T04:37:22.123267Z","title":"Vision-based manipulation from single human video with open-world object graphs.arXiv preprint arXiv:2405.20321, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.04600","last_updated":"2026-07-10T13:11:24Z","snapshot_observed_at":"2026-08-06T22:16:31.922188Z","submitted_at":"2026-02-04T14:28:14Z","title":"Act, Sense, Act: Learning Active Perception from Large-Scale Egocentric Human Data","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-03T04:37:22.123267Z"},"links":{"cited_paper":"/paper/2405.20321","citing_paper":"/paper/2602.04600"},"observation_digest":"sha256:7dc8ab8983f4fc1248930686e217621741e7a8e09bf2966b99b49ca946d84b5b","observation_id":"fa048d89-1e3a-422d-9ffd-dfe3e2ee3b1e","resolution":{"observed_at":"2026-08-03T04:37:22.123267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:37:22.210215Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.04600","last_updated":"2026-07-10T13:11:24Z","snapshot_observed_at":"2026-08-06T22:16:31.922188Z","submitted_at":"2026-02-04T14:28:14Z","title":"Act, Sense, Act: Learning Active Perception from Large-Scale Egocentric Human Data","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-03T04:37:22.210215Z"},"links":{"citing_paper":"/paper/2602.04600"},"observation_digest":"sha256:71fd0cec1c1e08e25b1600abb10b8874dcbb6db439457e52a1e71a47c83442a4","observation_id":"3dfae67a-f805-4360-a4a1-8419a72527b5","resolution":{"observed_at":"2026-08-03T04:37:22.210215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:37:22.317368Z","title":"We target the Cooking, Bike Repair, and Covid subsets, as these scenarios inherently require active visual search in cluttered scenes","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.04600","last_updated":"2026-07-10T13:11:24Z","snapshot_observed_at":"2026-08-06T22:16:31.922188Z","submitted_at":"2026-02-04T14:28:14Z","title":"Act, Sense, Act: Learning Active Perception from Large-Scale Egocentric Human Data","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-03T04:37:22.317368Z"},"links":{"citing_paper":"/paper/2602.04600"},"observation_digest":"sha256:01bf8b76cf3d03d8b500eaeee672d3f195bc18b278f677410c30fc6a18b2fcd9","observation_id":"47a8f0e3-66ff-423b-aac9-3925b0705c9d","resolution":{"observed_at":"2026-08-03T04:37:22.317368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:37:22.393260Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.04600","last_updated":"2026-07-10T13:11:24Z","snapshot_observed_at":"2026-08-06T22:16:31.922188Z","submitted_at":"2026-02-04T14:28:14Z","title":"Act, Sense, Act: Learning Active Perception from Large-Scale Egocentric Human Data","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-03T04:37:22.393260Z"},"links":{"citing_paper":"/paper/2602.04600"},"observation_digest":"sha256:778132b58fa4bb7e9e940fa4cf8345e0d8c85f5b1d738cb57a3300d45e5c84b9","observation_id":"66007496-501c-403a-bed4-646075ab2237","resolution":{"observed_at":"2026-08-03T04:37:22.393260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:37:22.484496Z","title":"This value is then linearly normalized to the range[0,1]to obtain a unified representation of hand opening","venue":null,"work_id":null,"year":2048},"citing_paper":{"arxiv_id":"2602.04600","last_updated":"2026-07-10T13:11:24Z","snapshot_observed_at":"2026-08-06T22:16:31.922188Z","submitted_at":"2026-02-04T14:28:14Z","title":"Act, Sense, Act: Learning Active Perception from Large-Scale Egocentric Human Data","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-03T04:37:22.484496Z"},"links":{"citing_paper":"/paper/2602.04600"},"observation_digest":"sha256:cc8cc306f0e0a9c947b5473658b91bd92ef17be3b68ff26495882066869971a2","observation_id":"4c2ce05e-c033-4418-be90-f0f1cc23df17","resolution":{"observed_at":"2026-08-03T04:37:22.484496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:37:22.642037Z","title":"sub-task completion","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.04600","last_updated":"2026-07-10T13:11:24Z","snapshot_observed_at":"2026-08-06T22:16:31.922188Z","submitted_at":"2026-02-04T14:28:14Z","title":"Act, Sense, Act: Learning Active Perception from Large-Scale Egocentric Human Data","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-03T04:37:22.642037Z"},"links":{"citing_paper":"/paper/2602.04600"},"observation_digest":"sha256:9c9e0c6900fee2652b7b4fb64d7be6e19ec364450a1849ed97e243a8426ab8ad","observation_id":"46493762-e42e-4ab0-8730-90ccac771e32","resolution":{"observed_at":"2026-08-03T04:37:22.642037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:37:22.730188Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.04600","last_updated":"2026-07-10T13:11:24Z","snapshot_observed_at":"2026-08-06T22:16:31.922188Z","submitted_at":"2026-02-04T14:28:14Z","title":"Act, Sense, Act: Learning Active Perception from Large-Scale Egocentric Human Data","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-03T04:37:22.730188Z"},"links":{"citing_paper":"/paper/2602.04600"},"observation_digest":"sha256:5a041d5947d901ee923cf4513d7ca5315a848dfc2a79dd718c23b05eee9bd70c","observation_id":"1a49fc71-4326-46dc-9df9-2a1a2ca0ea2e","resolution":{"observed_at":"2026-08-03T04:37:22.730188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:37:22.795452Z","title":"To minimize rotation time, the controller is bi-directional: it selects the orientation (forward or backward) that requires the smallest angular displacement","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.04600","last_updated":"2026-07-10T13:11:24Z","snapshot_observed_at":"2026-08-06T22:16:31.922188Z","submitted_at":"2026-02-04T14:28:14Z","title":"Act, Sense, Act: Learning Active Perception from Large-Scale Egocentric Human Data","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-03T04:37:22.795452Z"},"links":{"citing_paper":"/paper/2602.04600"},"observation_digest":"sha256:977eca763ab1e13ec9659a3201ab5ee1792cea354ed80ebdfc5bb2c6ffd1a735","observation_id":"02c906d5-3513-49ed-b961-63efb0d157a1","resolution":{"observed_at":"2026-08-03T04:37:22.795452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:37:22.864091Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.04600","last_updated":"2026-07-10T13:11:24Z","snapshot_observed_at":"2026-08-06T22:16:31.922188Z","submitted_at":"2026-02-04T14:28:14Z","title":"Act, Sense, Act: Learning Active Perception from Large-Scale Egocentric Human Data","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-03T04:37:22.864091Z"},"links":{"citing_paper":"/paper/2602.04600"},"observation_digest":"sha256:7df88f052f55604cc6357ad429c69491ccad071cc53b726b134bd41ecc5a8da4","observation_id":"c0884531-2a36-4b68-8eae-c3b1752e20d2","resolution":{"observed_at":"2026-08-03T04:37:22.864091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:37:22.984040Z","title":"All velocity commands are clamped within predefined safety bounds, i.e.,v∈[v min, vmax]andω∈[ω min, ωmax]","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.04600","last_updated":"2026-07-10T13:11:24Z","snapshot_observed_at":"2026-08-06T22:16:31.922188Z","submitted_at":"2026-02-04T14:28:14Z","title":"Act, Sense, Act: Learning Active Perception from Large-Scale Egocentric Human Data","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-03T04:37:22.984040Z"},"links":{"citing_paper":"/paper/2602.04600"},"observation_digest":"sha256:736fa12e7b051c08f0c5c8d1aa5e367028efc83ddb713b9d9e6c3a4a7e73d0c2","observation_id":"fd97e54e-fb75-438a-a726-946e66a07f0c","resolution":{"observed_at":"2026-08-03T04:37:22.984040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:37:23.134012Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.04600","last_updated":"2026-07-10T13:11:24Z","snapshot_observed_at":"2026-08-06T22:16:31.922188Z","submitted_at":"2026-02-04T14:28:14Z","title":"Act, Sense, Act: Learning Active Perception from Large-Scale Egocentric Human Data","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-03T04:37:23.134012Z"},"links":{"citing_paper":"/paper/2602.04600"},"observation_digest":"sha256:92fb3999012da055e005f8412cbcb3f65f9e7a0f6d04e9f201666ec72f2ad42e","observation_id":"9d166d0d-e11c-455e-b9a3-58966354721f","resolution":{"observed_at":"2026-08-03T04:37:23.134012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:37:23.223223Z","title":"These models are thus required to directly learn end-to-end execution of the entire task sequence without any sub-task switching mechanism","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.04600","last_updated":"2026-07-10T13:11:24Z","snapshot_observed_at":"2026-08-06T22:16:31.922188Z","submitted_at":"2026-02-04T14:28:14Z","title":"Act, Sense, Act: Learning Active Perception from Large-Scale Egocentric Human Data","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-03T04:37:23.223223Z"},"links":{"citing_paper":"/paper/2602.04600"},"observation_digest":"sha256:7131311907b4a257f836ea2f9f3d4ec4b230f993038d6bcd140abb7b44661472","observation_id":"80291f8f-933c-4c57-8ec1-e4a358dfbd01","resolution":{"observed_at":"2026-08-03T04:37:23.223223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:37:23.352697Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.04600","last_updated":"2026-07-10T13:11:24Z","snapshot_observed_at":"2026-08-06T22:16:31.922188Z","submitted_at":"2026-02-04T14:28:14Z","title":"Act, Sense, Act: Learning Active Perception from Large-Scale Egocentric Human Data","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-03T04:37:23.352697Z"},"links":{"citing_paper":"/paper/2602.04600"},"observation_digest":"sha256:1b7039125bba49f97e1946451ee4b7cf6a9b5d083d193729b2cf175b5881abef","observation_id":"b80c5d84-2b66-4752-99f8-3faa4c03e3fe","resolution":{"observed_at":"2026-08-03T04:37:23.352697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:37:23.418095Z","title":"Below we describe the implementation details of the ablations on the memory architecture","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.04600","last_updated":"2026-07-10T13:11:24Z","snapshot_observed_at":"2026-08-06T22:16:31.922188Z","submitted_at":"2026-02-04T14:28:14Z","title":"Act, Sense, Act: Learning Active Perception from Large-Scale Egocentric Human Data","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-03T04:37:23.418095Z"},"links":{"citing_paper":"/paper/2602.04600"},"observation_digest":"sha256:14884446cbc4a91b68907bc18b20deb405dd06f1ca71fe8b80a818e2772f34d1","observation_id":"bf265188-9c1b-41e0-a9c1-be8c00bb7e39","resolution":{"observed_at":"2026-08-03T04:37:23.418095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2602.04600","last_updated":"2026-07-10T13:11:24Z","latest_version":2,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-06T22:16:31.922188Z","submitted_at":"2026-02-04T14:28:14Z","title":"Act, Sense, Act: Learning Active Perception from Large-Scale Egocentric Human Data"},"reference_resolution":{"displayed":64,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":64,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":64},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 64 of 64 outbound references and 0 inbound Pith citation observations for arXiv:2602.04600."}