{"as_of":"2026-08-10T00:33:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:195c5d52662996c3a6ffcb79fe93f2e1cf5aaca597afc8083ea91f41cd3f33f7","coverage":[{"denominator":45,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T15:26:24.845540Z","state":"measured"},{"denominator":50,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":50,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T04:37:18.332035Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-01T22:26:17.693248Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.15833","last_updated":"2026-07-13T23:45:05Z","snapshot_observed_at":"2026-08-06T15:20:06.611013Z","submitted_at":"2025-07-21T17:44:10Z","title":"Look, Focus, Act: Efficient and Robust Robot Learning via Human Gaze and Foveated Vision Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.15833","snapshot_observed_at":"2026-08-03T04:37:18.332035Z","title":"Look, focus, act: Efficient and robust robot learning via human gaze and foveated vision transform- ers.arXiv preprint arXiv:2507.15833, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.04600","last_updated":"2026-07-10T13:11:24Z","snapshot_observed_at":"2026-08-09T17:05:35.906242Z","submitted_at":"2026-02-04T14:28:14Z","title":"Act, Sense, Act: Learning Active Perception from Large-Scale Egocentric Human Data","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T04:37:18.332035Z"},"links":{"cited_paper":"/paper/2507.15833","citing_paper":"/paper/2602.04600"},"observation_digest":"sha256:c6c6cbbb6c69814f727ca7565cc06e30b88d89c7dab9ca284e6dcdc5eea9e203","observation_id":"400d48b8-c366-4ddf-b290-5bc82097a836","resolution":{"observed_at":"2026-08-03T04:37:18.332035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15833","last_updated":"2026-07-13T23:45:05Z","snapshot_observed_at":"2026-08-06T15:20:06.611013Z","submitted_at":"2025-07-21T17:44:10Z","title":"Look, Focus, Act: Efficient and Robust Robot Learning via Human Gaze and Foveated Vision Transformers","version":3},"cited_work":{"arxiv_id":"2507.15833","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.15833","snapshot_observed_at":"2026-07-15T01:20:46.955469Z","title":"Look, focus, act: Efficient and robust robot learning via human gaze and foveated vision transform- ers","venue":null,"work_id":"d707f479-e8ad-4af4-8eb5-f862033cf504","year":2025},"citing_paper":{"arxiv_id":"2603.03243","last_updated":"2026-05-14T23:12:06Z","snapshot_observed_at":"2026-08-01T20:30:21.157166Z","submitted_at":"2026-03-03T18:36:49Z","title":"HoMMI: Learning Whole-Body Mobile Manipulation from Human Demonstrations","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-21T11:30:47.668896Z"},"links":{"cited_paper":"/paper/2507.15833","citing_paper":"/paper/2603.03243"},"observation_digest":"sha256:4a86001afa437dd5844d18d47cba53a9974bf343bd834e6912467f448a649320","observation_id":"faa22e20-d41f-4fc6-8fbb-7668f984ac9f","resolution":{"observed_at":"2026-07-15T01:20:46.955469Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15833","last_updated":"2026-07-13T23:45:05Z","snapshot_observed_at":"2026-08-06T15:20:06.611013Z","submitted_at":"2025-07-21T17:44:10Z","title":"Look, Focus, Act: Efficient and Robust Robot Learning via Human Gaze and Foveated Vision Transformers","version":3},"cited_work":{"arxiv_id":"2507.15833","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.15833","snapshot_observed_at":"2026-07-15T01:20:46.955469Z","title":"Look, focus, act: Efficient and robust robot learning via human gaze and foveated vision transform- ers","venue":null,"work_id":"d707f479-e8ad-4af4-8eb5-f862033cf504","year":2025},"citing_paper":{"arxiv_id":"2604.04439","last_updated":"2026-06-02T14:54:06Z","snapshot_observed_at":"2026-07-13T09:50:41.912206Z","submitted_at":"2026-04-06T05:39:29Z","title":"Estimating Central, Peripheral, and Temporal Visual Contributions to Human Decision Making in Atari Games","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-10T19:26:50.491037Z"},"links":{"cited_paper":"/paper/2507.15833","citing_paper":"/paper/2604.04439"},"observation_digest":"sha256:1099f22acc05f809764b9096e48a30b7643826fe7540171c94d5def88e542dc9","observation_id":"2418b343-508b-4533-b05e-0840b352c181","resolution":{"observed_at":"2026-07-15T01:20:46.955469Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15833","last_updated":"2026-07-13T23:45:05Z","snapshot_observed_at":"2026-08-06T15:20:06.611013Z","submitted_at":"2025-07-21T17:44:10Z","title":"Look, Focus, Act: Efficient and Robust Robot Learning via Human Gaze and Foveated Vision Transformers","version":3},"cited_work":{"arxiv_id":"2507.15833","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.15833","snapshot_observed_at":"2026-07-15T01:20:46.955469Z","title":"Look, focus, act: Efficient and robust robot learning via human gaze and foveated vision transform- ers","venue":null,"work_id":"d707f479-e8ad-4af4-8eb5-f862033cf504","year":2025},"citing_paper":{"arxiv_id":"2604.22615","last_updated":"2026-04-30T12:27:46Z","snapshot_observed_at":"2026-08-06T16:33:11.467195Z","submitted_at":"2026-04-24T14:46:03Z","title":"GazeVLA: Learning Human Intention for Robotic Manipulation","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-08T11:37:30.784513Z"},"links":{"cited_paper":"/paper/2507.15833","citing_paper":"/paper/2604.22615"},"observation_digest":"sha256:e83fa5c8d14851097731653fdff0e42bf31befced9fc3c7a89df2ff4c6e8c5bf","observation_id":"c2fdc816-f159-4253-8e4d-045e05a1d8b8","resolution":{"observed_at":"2026-07-15T01:20:46.955469Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15833","last_updated":"2026-07-13T23:45:05Z","snapshot_observed_at":"2026-08-06T15:20:06.611013Z","submitted_at":"2025-07-21T17:44:10Z","title":"Look, Focus, Act: Efficient and Robust Robot Learning via Human Gaze and Foveated Vision Transformers","version":3},"cited_work":{"arxiv_id":"2507.15833","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.15833","snapshot_observed_at":"2026-07-15T01:20:46.955469Z","title":"Look, focus, act: Efficient and robust robot learning via human gaze and foveated vision transform- ers","venue":null,"work_id":"d707f479-e8ad-4af4-8eb5-f862033cf504","year":2025},"citing_paper":{"arxiv_id":"2606.02565","last_updated":"2026-06-01T17:55:05Z","snapshot_observed_at":"2026-07-06T23:42:58.036516Z","submitted_at":"2026-06-01T17:55:05Z","title":"Policy-based Foveated Imaging and Perception","version":1},"reference_index":179,"source":"arxiv_source","source_observed_at":"2026-06-28T15:23:48.688620Z"},"links":{"cited_paper":"/paper/2507.15833","citing_paper":"/paper/2606.02565"},"observation_digest":"sha256:ee7fd9fbf2a67111209787e2b5d81ba4baa1fb2ec4e6c12bbb2d8ccca8f35f93","observation_id":"8931d48f-eab7-4ddb-b650-a5167fc2ec83","resolution":{"observed_at":"2026-07-15T01:20:46.955469Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.15833/citation-record","integrity":"/paper/2507.15833/integrity","json":"/paper/2507.15833/citation-record.json","paper":"/paper/2507.15833"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2304.13705","last_updated":"2023-04-23T19:10:53Z","snapshot_observed_at":"2026-08-03T01:22:01.078078Z","submitted_at":"2023-04-23T19:10:53Z","title":"Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.13705","snapshot_observed_at":"2026-08-06T15:26:24.700155Z","title":"Learning fine-grained bimanual manipulation with low-cost hardware,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15833","last_updated":"2026-07-13T23:45:05Z","snapshot_observed_at":"2026-08-06T15:20:06.611013Z","submitted_at":"2025-07-21T17:44:10Z","title":"Look, Focus, Act: Efficient and Robust Robot Learning via Human Gaze and Foveated Vision Transformers","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T15:26:24.700155Z"},"links":{"cited_paper":"/paper/2304.13705","citing_paper":"/paper/2507.15833"},"observation_digest":"sha256:c915db8932cacd701eca0af580a3488cfe5eed1da2063b19977b08527720539e","observation_id":"ce980063-9b2b-461b-838a-d2ef1010ad05","resolution":{"observed_at":"2026-08-06T15:26:24.700155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13126","last_updated":"2024-10-17T01:29:49Z","snapshot_observed_at":"2026-08-09T05:00:07.972958Z","submitted_at":"2024-10-17T01:29:49Z","title":"ALOHA Unleashed: A Simple Recipe for Robot Dexterity","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13126","snapshot_observed_at":"2026-08-06T15:26:24.704197Z","title":"Aloha unleashed: A simple recipe for robot dexterity,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15833","last_updated":"2026-07-13T23:45:05Z","snapshot_observed_at":"2026-08-06T15:20:06.611013Z","submitted_at":"2025-07-21T17:44:10Z","title":"Look, Focus, Act: Efficient and Robust Robot Learning via Human Gaze and Foveated Vision Transformers","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T15:26:24.704197Z"},"links":{"cited_paper":"/paper/2410.13126","citing_paper":"/paper/2507.15833"},"observation_digest":"sha256:6cfbdd755eaf4fb7bd71b6a3c847fdc945ab233d8776cdb854ea240d81f93dda","observation_id":"8d036f2d-56b9-4d0f-a3c2-c84d3e005baa","resolution":{"observed_at":"2026-08-06T15:26:24.704197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.07914","last_updated":"2024-10-16T08:52:42Z","snapshot_observed_at":"2026-08-10T00:01:20.300576Z","submitted_at":"2024-09-12T10:30:44Z","title":"InterACT: Inter-dependency Aware Action Chunking with Hierarchical Attention Transformers for Bimanual Manipulation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.07914","snapshot_observed_at":"2026-08-06T15:26:24.707646Z","title":"Interact: Inter- dependency aware action chunking with hierarchical attention trans- formers for bimanual manipulation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15833","last_updated":"2026-07-13T23:45:05Z","snapshot_observed_at":"2026-08-06T15:20:06.611013Z","submitted_at":"2025-07-21T17:44:10Z","title":"Look, Focus, Act: Efficient and Robust Robot Learning via Human Gaze and Foveated Vision Transformers","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T15:26:24.707646Z"},"links":{"cited_paper":"/paper/2409.07914","citing_paper":"/paper/2507.15833"},"observation_digest":"sha256:a9ff02b950f1ead0d5056278754430f063dcde9f7fe05722dc8644e7dd5a274a","observation_id":"ac3e2aa1-72c6-4dce-af6e-7e9098bc9efd","resolution":{"observed_at":"2026-08-06T15:26:24.707646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:26:24.711214Z","title":"Vita: Vision-to-action flow matching policy,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.15833","last_updated":"2026-07-13T23:45:05Z","snapshot_observed_at":"2026-08-06T15:20:06.611013Z","submitted_at":"2025-07-21T17:44:10Z","title":"Look, Focus, Act: Efficient and Robust Robot Learning via Human Gaze and Foveated Vision Transformers","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T15:26:24.711214Z"},"links":{"citing_paper":"/paper/2507.15833"},"observation_digest":"sha256:9af47cc613fac6ff0b2793aff3355dcd416b7df14d66315fdc8b1672b0860f3d","observation_id":"8017729d-db14-493f-a309-65fcb4b4572b","resolution":{"observed_at":"2026-08-06T15:26:24.711214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10803","last_updated":"2025-09-09T09:24:29Z","snapshot_observed_at":"2026-08-05T12:04:21.579432Z","submitted_at":"2024-10-14T17:59:00Z","title":"Generalizable Humanoid Manipulation with 3D Diffusion Policies","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10803","snapshot_observed_at":"2026-08-06T15:26:24.714604Z","title":"Generalizable humanoid manipulation with improved 3d diffusion policies,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15833","last_updated":"2026-07-13T23:45:05Z","snapshot_observed_at":"2026-08-06T15:20:06.611013Z","submitted_at":"2025-07-21T17:44:10Z","title":"Look, Focus, Act: Efficient and Robust Robot Learning via Human Gaze and Foveated Vision Transformers","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T15:26:24.714604Z"},"links":{"cited_paper":"/paper/2410.10803","citing_paper":"/paper/2507.15833"},"observation_digest":"sha256:d6eff74b92d7b9cba20c199ae071f0bd4a67901e1ddb1b016dca223a849af330","observation_id":"4ef3337a-8f3a-4766-8946-6f089d06e628","resolution":{"observed_at":"2026-08-06T15:26:24.714604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:26:25.610764Z","title":"Flow matching imitation learning for multi-support manipulation,","venue":null,"work_id":"b12f87c3-4d4e-4b76-8fc6-a7b26904c7c9","year":2024},"citing_paper":{"arxiv_id":"2507.15833","last_updated":"2026-07-13T23:45:05Z","snapshot_observed_at":"2026-08-06T15:20:06.611013Z","submitted_at":"2025-07-21T17:44:10Z","title":"Look, Focus, Act: Efficient and Robust Robot Learning via Human Gaze and Foveated Vision Transformers","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T15:26:24.717772Z"},"links":{"citing_paper":"/paper/2507.15833"},"observation_digest":"sha256:7fbcc18193495df5c5ad2491440083cf492756ee4892f58707b7c575c435ded8","observation_id":"be4fd690-f188-45c2-ad0f-80bce9964087","resolution":{"observed_at":"2026-08-06T15:26:25.614565Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21229","last_updated":"2025-03-06T07:50:56Z","snapshot_observed_at":"2026-08-07T04:45:06.794433Z","submitted_at":"2024-10-28T17:15:24Z","title":"HOVER: Versatile Neural Whole-Body Controller for Humanoid Robots","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21229","snapshot_observed_at":"2026-08-06T15:26:24.721012Z","title":"Hover: Versatile neural whole-body controller for humanoid robots,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15833","last_updated":"2026-07-13T23:45:05Z","snapshot_observed_at":"2026-08-06T15:20:06.611013Z","submitted_at":"2025-07-21T17:44:10Z","title":"Look, Focus, Act: Efficient and Robust Robot Learning via Human Gaze and Foveated Vision Transformers","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T15:26:24.721012Z"},"links":{"cited_paper":"/paper/2410.21229","citing_paper":"/paper/2507.15833"},"observation_digest":"sha256:588bad4936e705a770f7ede096caccde1956c2e8c916d4ecd615daec4d23321f","observation_id":"9d405417-9ffc-45f0-9c01-85dd22b99060","resolution":{"observed_at":"2026-08-06T15:26:24.721012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:26:24.724047Z","title":"Diffusion policy: Visuomotor policy learning via ac- tion diffusion,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15833","last_updated":"2026-07-13T23:45:05Z","snapshot_observed_at":"2026-08-06T15:20:06.611013Z","submitted_at":"2025-07-21T17:44:10Z","title":"Look, Focus, Act: Efficient and Robust Robot Learning via Human Gaze and Foveated Vision Transformers","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T15:26:24.724047Z"},"links":{"citing_paper":"/paper/2507.15833"},"observation_digest":"sha256:cb998b3d18b200ce44977396e16a1cd2cfa69981b66e53487295f4c9c0f1c7d8","observation_id":"7b63a1f5-d7fc-4df5-8bdf-4adad98b9637","resolution":{"observed_at":"2026-08-06T15:26:24.724047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:26:25.592508Z","title":"The foveal confluence in human visual cortex,","venue":null,"work_id":"fd07fb27-e6ab-4ef6-a153-cc962cbd8b30","year":2009},"citing_paper":{"arxiv_id":"2507.15833","last_updated":"2026-07-13T23:45:05Z","snapshot_observed_at":"2026-08-06T15:20:06.611013Z","submitted_at":"2025-07-21T17:44:10Z","title":"Look, Focus, Act: Efficient and Robust Robot Learning via Human Gaze and Foveated Vision Transformers","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T15:26:24.727042Z"},"links":{"citing_paper":"/paper/2507.15833"},"observation_digest":"sha256:294044e09b04487ee4384c1df389cdeba21098c199b2909d346f55de66b19252","observation_id":"38b966fb-cf15-464d-af2d-ef33f778f2a0","resolution":{"observed_at":"2026-08-06T15:26:25.597089Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:26:25.582193Z","title":"Embedded foveation image coding,","venue":null,"work_id":"7e337d39-3d93-433c-8fb1-33efa515b880","year":2001},"citing_paper":{"arxiv_id":"2507.15833","last_updated":"2026-07-13T23:45:05Z","snapshot_observed_at":"2026-08-06T15:20:06.611013Z","submitted_at":"2025-07-21T17:44:10Z","title":"Look, Focus, Act: Efficient and Robust Robot Learning via Human Gaze and Foveated Vision Transformers","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T15:26:24.729740Z"},"links":{"citing_paper":"/paper/2507.15833"},"observation_digest":"sha256:8adfcfd4f3693f95687a1d5db114e8be6beccfd46d5bb3842e830e85f70e63c2","observation_id":"a00962be-6c6e-4613-9abd-f1b73dba7680","resolution":{"observed_at":"2026-08-06T15:26:25.585592Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1371/journal.pcbi.1005743","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:26:24.875178Z","title":"Object detection through search with a foveated visual system,","venue":null,"work_id":"75158c62-ab5f-4af8-94b1-fbbd2cd7de5e","year":2017},"citing_paper":{"arxiv_id":"2507.15833","last_updated":"2026-07-13T23:45:05Z","snapshot_observed_at":"2026-08-06T15:20:06.611013Z","submitted_at":"2025-07-21T17:44:10Z","title":"Look, Focus, Act: Efficient and Robust Robot Learning via Human Gaze and Foveated Vision Transformers","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T15:26:24.732580Z"},"links":{"citing_paper":"/paper/2507.15833"},"observation_digest":"sha256:52a8774b5168c3a6d898c2cca2bff8869f702c9be7b0daa240b9278f21770154","observation_id":"3cf9e613-3c93-448c-a293-fcc2cae307f0","resolution":{"observed_at":"2026-08-06T15:26:24.880287Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17435","last_updated":"2025-03-08T01:43:40Z","snapshot_observed_at":"2026-08-04T01:39:32.450725Z","submitted_at":"2024-09-26T00:05:36Z","title":"Active Vision Might Be All You Need: Exploring Active Vision in Bimanual Robotic Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.17435","snapshot_observed_at":"2026-08-06T15:26:24.735889Z","title":"Active vision might be all you need: Exploring active vision in bimanual robotic manipulation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15833","last_updated":"2026-07-13T23:45:05Z","snapshot_observed_at":"2026-08-06T15:20:06.611013Z","submitted_at":"2025-07-21T17:44:10Z","title":"Look, Focus, Act: Efficient and Robust Robot Learning via Human Gaze and Foveated Vision Transformers","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T15:26:24.735889Z"},"links":{"cited_paper":"/paper/2409.17435","citing_paper":"/paper/2507.15833"},"observation_digest":"sha256:071fd83920a8ea6474db4346e0dff75e77859fb0c771765e4532744cfe444834","observation_id":"a434271e-8c86-4fdc-8ea3-b511b3c1fc0c","resolution":{"observed_at":"2026-08-06T15:26:24.735889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01512","last_updated":"2024-07-08T16:59:38Z","snapshot_observed_at":"2026-07-06T18:39:43.472708Z","submitted_at":"2024-07-01T17:55:35Z","title":"Open-TeleVision: Teleoperation with Immersive Active Visual Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01512","snapshot_observed_at":"2026-08-06T15:26:24.739499Z","title":"Open-television: Teleoperation with immersive active visual feedback,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15833","last_updated":"2026-07-13T23:45:05Z","snapshot_observed_at":"2026-08-06T15:20:06.611013Z","submitted_at":"2025-07-21T17:44:10Z","title":"Look, Focus, Act: Efficient and Robust Robot Learning via Human Gaze and Foveated Vision Transformers","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T15:26:24.739499Z"},"links":{"cited_paper":"/paper/2407.01512","citing_paper":"/paper/2507.15833"},"observation_digest":"sha256:5425e7ceb0c5a3e51436c2d5c32174bc9b413516786dbe7bfd0dd52e654da6c5","observation_id":"7c8085e4-1413-4275-9c96-7767ec56c83f","resolution":{"observed_at":"2026-08-06T15:26:24.739499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-06T15:26:24.742657Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2507.15833","last_updated":"2026-07-13T23:45:05Z","snapshot_observed_at":"2026-08-06T15:20:06.611013Z","submitted_at":"2025-07-21T17:44:10Z","title":"Look, Focus, Act: Efficient and Robust Robot Learning via Human Gaze and Foveated Vision Transformers","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T15:26:24.742657Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2507.15833"},"observation_digest":"sha256:a5a616addf9277d2cce3952515180463b87f7a552d2209190892d24401284cbd","observation_id":"2625bef8-c72f-4b74-b1f6-4bb7ede446be","resolution":{"observed_at":"2026-08-06T15:26:24.742657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-09T18:02:17.307812Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-06T15:26:24.745877Z","title":"Dinov2: Learning robust visual features without supervision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15833","last_updated":"2026-07-13T23:45:05Z","snapshot_observed_at":"2026-08-06T15:20:06.611013Z","submitted_at":"2025-07-21T17:44:10Z","title":"Look, Focus, Act: Efficient and Robust Robot Learning via Human Gaze and Foveated Vision Transformers","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T15:26:24.745877Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2507.15833"},"observation_digest":"sha256:0b46b7768474cd9ec977fbbbe191d5f3c81fe6f51c6d04880fded89dae825dff","observation_id":"27dd0c2d-8413-437c-af29-e4eefe655da4","resolution":{"observed_at":"2026-08-06T15:26:24.745877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18647","last_updated":"2026-06-26T02:30:53Z","snapshot_observed_at":"2026-07-06T19:39:01.657517Z","submitted_at":"2024-10-24T11:19:30Z","title":"Data Scaling Laws in Imitation Learning for Robotic Manipulation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.18647","snapshot_observed_at":"2026-08-06T15:26:24.749095Z","title":"Data scaling laws in imitation learning for robotic manipulation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15833","last_updated":"2026-07-13T23:45:05Z","snapshot_observed_at":"2026-08-06T15:20:06.611013Z","submitted_at":"2025-07-21T17:44:10Z","title":"Look, Focus, Act: Efficient and Robust Robot Learning via Human Gaze and Foveated Vision Transformers","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T15:26:24.749095Z"},"links":{"cited_paper":"/paper/2410.18647","citing_paper":"/paper/2507.15833"},"observation_digest":"sha256:18c4e4ee487f815bb880fadfe59dc9dc1ade2c53d3117d19a622d07056f9f33e","observation_id":"7bcea48b-5d35-4a42-8f3e-845284cd1aed","resolution":{"observed_at":"2026-08-06T15:26:24.749095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.14974","last_updated":"2024-12-06T11:39:35Z","snapshot_observed_at":"2026-07-06T19:36:19.567469Z","submitted_at":"2024-10-19T04:37:01Z","title":"CAGE: Causal Attention Enables Data-Efficient Generalizable Robotic Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.14974","snapshot_observed_at":"2026-08-06T15:26:24.752532Z","title":"Cage: Causal attention en- ables data-efficient generalizable robotic manipulation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15833","last_updated":"2026-07-13T23:45:05Z","snapshot_observed_at":"2026-08-06T15:20:06.611013Z","submitted_at":"2025-07-21T17:44:10Z","title":"Look, Focus, Act: Efficient and Robust Robot Learning via Human Gaze and Foveated Vision Transformers","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T15:26:24.752532Z"},"links":{"cited_paper":"/paper/2410.14974","citing_paper":"/paper/2507.15833"},"observation_digest":"sha256:398e358f70eff7eb437549de0121cc56b3f2c1adfbb8c5dc1811aade3cebab27","observation_id":"f14a265d-03eb-4514-bb7d-7197b5033bbc","resolution":{"observed_at":"2026-08-06T15:26:24.752532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:26:25.571102Z","title":"Segment this thing: Foveated tok- enization for efficient point-prompted segmentation,","venue":null,"work_id":"eb559f78-824a-4b40-9d08-831fe3dd17da","year":2025},"citing_paper":{"arxiv_id":"2507.15833","last_updated":"2026-07-13T23:45:05Z","snapshot_observed_at":"2026-08-06T15:20:06.611013Z","submitted_at":"2025-07-21T17:44:10Z","title":"Look, Focus, Act: Efficient and Robust Robot Learning via Human Gaze and Foveated Vision Transformers","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T15:26:24.755787Z"},"links":{"citing_paper":"/paper/2507.15833"},"observation_digest":"sha256:6ee0b0f406900696a899360259acde3cfc0a9863252a8920275833a6fa31ad65","observation_id":"88fd0ff6-82b8-463e-91c8-1287cee38fa0","resolution":{"observed_at":"2026-08-06T15:26:25.574949Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:26:25.558439Z","title":"Non-extensive distribution of human eye photoreceptors,","venue":null,"work_id":"911a1645-67bc-4d63-902c-95cf8028c711","year":2017},"citing_paper":{"arxiv_id":"2507.15833","last_updated":"2026-07-13T23:45:05Z","snapshot_observed_at":"2026-08-06T15:20:06.611013Z","submitted_at":"2025-07-21T17:44:10Z","title":"Look, Focus, Act: Efficient and Robust Robot Learning via Human Gaze and Foveated Vision Transformers","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T15:26:24.759024Z"},"links":{"citing_paper":"/paper/2507.15833"},"observation_digest":"sha256:3316d5530e22498cb85ccf1024cb6d880b838eb2cdefc38d099bdcf1dabb9252","observation_id":"5aca11cf-b514-43f6-9e04-287915fc0983","resolution":{"observed_at":"2026-08-06T15:26:25.563037Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:26:24.762941Z","title":"Marr,Vision: A computational investigation into the human repre- sentation and processing of visual information","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2507.15833","last_updated":"2026-07-13T23:45:05Z","snapshot_observed_at":"2026-08-06T15:20:06.611013Z","submitted_at":"2025-07-21T17:44:10Z","title":"Look, Focus, Act: Efficient and Robust Robot Learning via Human Gaze and Foveated Vision Transformers","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T15:26:24.762941Z"},"links":{"citing_paper":"/paper/2507.15833"},"observation_digest":"sha256:5bb695ae675724e1140a781da823d8c984b1b6f579823b547293c2b352ae7d64","observation_id":"ad4aa7f2-ebb3-49c5-9666-77ede44a1721","resolution":{"observed_at":"2026-08-06T15:26:24.762941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:26:25.540667Z","title":"Recognition-by-components: a theory of human image understanding","venue":null,"work_id":"486b3096-6988-4539-bfde-82a14d1faf60","year":1987},"citing_paper":{"arxiv_id":"2507.15833","last_updated":"2026-07-13T23:45:05Z","snapshot_observed_at":"2026-08-06T15:20:06.611013Z","submitted_at":"2025-07-21T17:44:10Z","title":"Look, Focus, Act: Efficient and Robust Robot Learning via Human Gaze and Foveated Vision Transformers","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T15:26:24.766260Z"},"links":{"citing_paper":"/paper/2507.15833"},"observation_digest":"sha256:d31c02d681cfaa21fc6060a42172e72abecf6c07a7a036cec19f489045e8334b","observation_id":"916aa16d-60e9-4fe8-aebd-b97c28eeae05","resolution":{"observed_at":"2026-08-06T15:26:25.544217Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:26:25.529776Z","title":"Neural mechanisms of selective visual attention,","venue":null,"work_id":"2ec1397f-3f7b-4be9-84c6-cc6c325d5dea","year":1995},"citing_paper":{"arxiv_id":"2507.15833","last_updated":"2026-07-13T23:45:05Z","snapshot_observed_at":"2026-08-06T15:20:06.611013Z","submitted_at":"2025-07-21T17:44:10Z","title":"Look, Focus, Act: Efficient and Robust Robot Learning via Human Gaze and Foveated Vision Transformers","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T15:26:24.769210Z"},"links":{"citing_paper":"/paper/2507.15833"},"observation_digest":"sha256:4b12ac2182b7f8cd5937adc2ee59bebebd99e8e37aeab7a8ee03efdd04a84672","observation_id":"9fcb47e2-20db-4f1d-9282-afb2d5973d9d","resolution":{"observed_at":"2026-08-06T15:26:25.533996Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:26:25.519303Z","title":"How does the brain solve visual object recognition?","venue":null,"work_id":"f0619e61-d447-4269-a329-31c638de93f9","year":2012},"citing_paper":{"arxiv_id":"2507.15833","last_updated":"2026-07-13T23:45:05Z","snapshot_observed_at":"2026-08-06T15:20:06.611013Z","submitted_at":"2025-07-21T17:44:10Z","title":"Look, Focus, Act: Efficient and Robust Robot Learning via Human Gaze and Foveated Vision Transformers","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T15:26:24.772234Z"},"links":{"citing_paper":"/paper/2507.15833"},"observation_digest":"sha256:ae97ce3a0f2864d178a14d9e112290dc0400af0dd62f8df08b74bb02f2c4aa4a","observation_id":"c218dcc9-e614-44e8-88ed-5fedcde6beda","resolution":{"observed_at":"2026-08-06T15:26:25.522885Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:26:25.507019Z","title":"Performance-optimized hierarchical models predict neural responses in higher visual cortex,","venue":null,"work_id":"8c0b945a-3664-4942-968f-ff78c3cdca6b","year":2014},"citing_paper":{"arxiv_id":"2507.15833","last_updated":"2026-07-13T23:45:05Z","snapshot_observed_at":"2026-08-06T15:20:06.611013Z","submitted_at":"2025-07-21T17:44:10Z","title":"Look, Focus, Act: Efficient and Robust Robot Learning via Human Gaze and Foveated Vision Transformers","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T15:26:24.775393Z"},"links":{"citing_paper":"/paper/2507.15833"},"observation_digest":"sha256:b4d664a02e50f09795b4696bd999b1f2ee4b163f0330954f8002d03ea786dc7d","observation_id":"669436bb-8971-43f8-9dda-8ad4d82dd3a0","resolution":{"observed_at":"2026-08-06T15:26:25.511051Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:26:25.494755Z","title":"Context mitigates crowding: Peripheral object recognition in real-world images,","venue":null,"work_id":"11f0bad2-e90d-4887-9ff2-5cc9b778dd3a","year":2018},"citing_paper":{"arxiv_id":"2507.15833","last_updated":"2026-07-13T23:45:05Z","snapshot_observed_at":"2026-08-06T15:20:06.611013Z","submitted_at":"2025-07-21T17:44:10Z","title":"Look, Focus, Act: Efficient and Robust Robot Learning via Human Gaze and Foveated Vision Transformers","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T15:26:24.778460Z"},"links":{"citing_paper":"/paper/2507.15833"},"observation_digest":"sha256:6cee24c893bb8adcb08341e4ae01d9f5f01eed6a5d03717ab9aacaaa66f39f05","observation_id":"810fd713-c875-4ffb-842d-55542a02b1bf","resolution":{"observed_at":"2026-08-06T15:26:25.499154Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.07991","last_updated":"2021-06-22T21:21:08Z","snapshot_observed_at":"2026-07-06T09:28:59.431672Z","submitted_at":"2020-06-14T19:34:44Z","title":"Emergent Properties of Foveated Perceptual Systems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.07991","snapshot_observed_at":"2026-08-06T15:26:24.781610Z","title":"Emergent properties of foveated perceptual systems,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2507.15833","last_updated":"2026-07-13T23:45:05Z","snapshot_observed_at":"2026-08-06T15:20:06.611013Z","submitted_at":"2025-07-21T17:44:10Z","title":"Look, Focus, Act: Efficient and Robust Robot Learning via Human Gaze and Foveated Vision Transformers","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T15:26:24.781610Z"},"links":{"cited_paper":"/paper/2006.07991","citing_paper":"/paper/2507.15833"},"observation_digest":"sha256:a15da4e3a9afa97204f2421c15407b8bd94728addae27375360b3261da021786","observation_id":"47c9fc71-658c-4f85-9121-f8b073862ab9","resolution":{"observed_at":"2026-08-06T15:26:24.781610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:26:25.481890Z","title":"Biologically inspired deep learning model for efficient foveal-peripheral vision,","venue":null,"work_id":"6677eea1-c0f3-42b3-9a7a-0f819eae7de9","year":2021},"citing_paper":{"arxiv_id":"2507.15833","last_updated":"2026-07-13T23:45:05Z","snapshot_observed_at":"2026-08-06T15:20:06.611013Z","submitted_at":"2025-07-21T17:44:10Z","title":"Look, Focus, Act: Efficient and Robust Robot Learning via Human Gaze and Foveated Vision Transformers","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T15:26:24.784603Z"},"links":{"citing_paper":"/paper/2507.15833"},"observation_digest":"sha256:656a6476452792809759e0649daa7a9e6fb7e7d5bd691386791d4d7e8f0d19b0","observation_id":"2e748845-bfc4-43c3-898b-e83baf2d5dfe","resolution":{"observed_at":"2026-08-06T15:26:25.485670Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.14173","last_updated":"2022-10-02T19:59:49Z","snapshot_observed_at":"2026-07-06T11:13:54.995111Z","submitted_at":"2021-05-29T01:54:33Z","title":"FoveaTer: Foveated Transformer for Image Classification","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.14173","snapshot_observed_at":"2026-08-06T15:26:24.787335Z","title":"Foveater: Foveated transformer for image classification,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.15833","last_updated":"2026-07-13T23:45:05Z","snapshot_observed_at":"2026-08-06T15:20:06.611013Z","submitted_at":"2025-07-21T17:44:10Z","title":"Look, Focus, Act: Efficient and Robust Robot Learning via Human Gaze and Foveated Vision Transformers","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T15:26:24.787335Z"},"links":{"cited_paper":"/paper/2105.14173","citing_paper":"/paper/2507.15833"},"observation_digest":"sha256:e3534a4bf76900658665dd66f6cce4bdd1e9d8793adbc18f756e27d961035601","observation_id":"951fb8fd-cdc0-49b5-9e8e-b5c02e4615d6","resolution":{"observed_at":"2026-08-06T15:26:24.787335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:26:25.471569Z","title":"Peripheral vision transformer,","venue":null,"work_id":"7a4e4bf2-3f08-4976-9032-04ef36b14a0c","year":2022},"citing_paper":{"arxiv_id":"2507.15833","last_updated":"2026-07-13T23:45:05Z","snapshot_observed_at":"2026-08-06T15:20:06.611013Z","submitted_at":"2025-07-21T17:44:10Z","title":"Look, Focus, Act: Efficient and Robust Robot Learning via Human Gaze and Foveated Vision Transformers","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T15:26:24.790467Z"},"links":{"citing_paper":"/paper/2507.15833"},"observation_digest":"sha256:df507ab37b70937a03fe342401c1a08e9364d0212409ed3017af408d443b4327","observation_id":"428f0ab1-805a-4257-a633-35a4991b71a0","resolution":{"observed_at":"2026-08-06T15:26:25.474845Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:26:25.459685Z","title":"An eye-gaze tracking system for teleoperation of a mobile robot,","venue":null,"work_id":"ba29b060-9dab-4e0b-aefc-1c6127af4fb9","year":2018},"citing_paper":{"arxiv_id":"2507.15833","last_updated":"2026-07-13T23:45:05Z","snapshot_observed_at":"2026-08-06T15:20:06.611013Z","submitted_at":"2025-07-21T17:44:10Z","title":"Look, Focus, Act: Efficient and Robust Robot Learning via Human Gaze and Foveated Vision Transformers","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T15:26:24.793147Z"},"links":{"citing_paper":"/paper/2507.15833"},"observation_digest":"sha256:914f9422656404330cdba3c225a05d16acf108ba93b64b405dfef8a518ce9e02","observation_id":"017d69eb-54fb-4671-bf3f-860f74b47cf3","resolution":{"observed_at":"2026-08-06T15:26:25.464210Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:26:25.446771Z","title":"The human gaze helps robots run bravely and efficiently in crowds,","venue":null,"work_id":"98ef95fc-b604-411f-bbfe-8317077f8908","year":2023},"citing_paper":{"arxiv_id":"2507.15833","last_updated":"2026-07-13T23:45:05Z","snapshot_observed_at":"2026-08-06T15:20:06.611013Z","submitted_at":"2025-07-21T17:44:10Z","title":"Look, Focus, Act: Efficient and Robust Robot Learning via Human Gaze and Foveated Vision Transformers","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T15:26:24.796342Z"},"links":{"citing_paper":"/paper/2507.15833"},"observation_digest":"sha256:5f836f6dd82d6822e4114e28255edbc46a3d174202f8f257c7b62403ce03cabb","observation_id":"65a6cf5a-6c50-4924-a0ae-8bed3a150269","resolution":{"observed_at":"2026-08-06T15:26:25.450860Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:26:24.799515Z","title":"Gaze-based intention estimation: principles, method- ologies, and applications in hri,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15833","last_updated":"2026-07-13T23:45:05Z","snapshot_observed_at":"2026-08-06T15:20:06.611013Z","submitted_at":"2025-07-21T17:44:10Z","title":"Look, Focus, Act: Efficient and Robust Robot Learning via Human Gaze and Foveated Vision Transformers","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T15:26:24.799515Z"},"links":{"citing_paper":"/paper/2507.15833"},"observation_digest":"sha256:24e34907ff60280629fb87effe56e1d4feddf41e88e2c72b9de2a3e71b16bacd","observation_id":"848ce0ca-81f4-4fa7-b6e0-0d1a9c074a5e","resolution":{"observed_at":"2026-08-06T15:26:24.799515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:26:25.429445Z","title":"Visarl: Visual reinforcement learning guided by human saliency,","venue":null,"work_id":"2114d698-72ef-4122-a58c-6ab799e62708","year":2024},"citing_paper":{"arxiv_id":"2507.15833","last_updated":"2026-07-13T23:45:05Z","snapshot_observed_at":"2026-08-06T15:20:06.611013Z","submitted_at":"2025-07-21T17:44:10Z","title":"Look, Focus, Act: Efficient and Robust Robot Learning via Human Gaze and Foveated Vision Transformers","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T15:26:24.802352Z"},"links":{"citing_paper":"/paper/2507.15833"},"observation_digest":"sha256:0a9d947a7711edc77461ea08ca2448bfe32d313364a6e8110c014644c0f9456d","observation_id":"026380ae-af67-45ea-ae5e-f616a70dfa6f","resolution":{"observed_at":"2026-08-06T15:26:25.432702Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:26:24.805436Z","title":"Eye, robot: Learning to look to act with a bc-rl perception-action loop,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.15833","last_updated":"2026-07-13T23:45:05Z","snapshot_observed_at":"2026-08-06T15:20:06.611013Z","submitted_at":"2025-07-21T17:44:10Z","title":"Look, Focus, Act: Efficient and Robust Robot Learning via Human Gaze and Foveated Vision Transformers","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T15:26:24.805436Z"},"links":{"citing_paper":"/paper/2507.15833"},"observation_digest":"sha256:c886f792b13be2b8796ce5c14c4b18b19f4e3c5df21746b34fdbbfd4f2a2f909","observation_id":"4f67658a-517d-46cd-8fad-00f374018f91","resolution":{"observed_at":"2026-08-06T15:26:24.805436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:26:25.418675Z","title":"Using human gaze to improve robustness against irrelevant objects in robot manipulation tasks,","venue":null,"work_id":"113d7766-fd1b-440c-91a4-c2ef9898c1b8","year":2020},"citing_paper":{"arxiv_id":"2507.15833","last_updated":"2026-07-13T23:45:05Z","snapshot_observed_at":"2026-08-06T15:20:06.611013Z","submitted_at":"2025-07-21T17:44:10Z","title":"Look, Focus, Act: Efficient and Robust Robot Learning via Human Gaze and Foveated Vision Transformers","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T15:26:24.808245Z"},"links":{"citing_paper":"/paper/2507.15833"},"observation_digest":"sha256:61a0c6e8a961410db0020e93c371ea8bf6ca163931c0db614d9a2f2e92582659","observation_id":"92743b18-ef07-4803-b0fb-ebea9843e7a2","resolution":{"observed_at":"2026-08-06T15:26:25.422245Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:26:25.406182Z","title":"Gaze-based dual resolution deep imitation learning for high- precision dexterous robot manipulation,","venue":null,"work_id":"b8b13179-88c1-47a7-ba31-9a00f7486fc7","year":2021},"citing_paper":{"arxiv_id":"2507.15833","last_updated":"2026-07-13T23:45:05Z","snapshot_observed_at":"2026-08-06T15:20:06.611013Z","submitted_at":"2025-07-21T17:44:10Z","title":"Look, Focus, Act: Efficient and Robust Robot Learning via Human Gaze and Foveated Vision Transformers","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T15:26:24.811096Z"},"links":{"citing_paper":"/paper/2507.15833"},"observation_digest":"sha256:8e344f8f9ab1696dd29647cf1337f9fbea885e0a52729e086abcf05208f341fa","observation_id":"3ed6b318-5ca3-4629-bb99-58e8307b70e8","resolution":{"observed_at":"2026-08-06T15:26:25.410990Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:26:25.392595Z","title":"Multi-task real-robot data with gaze attention for dual-arm fine manipulation,","venue":null,"work_id":"364534f7-e185-45da-b80d-f36427eddf53","year":2024},"citing_paper":{"arxiv_id":"2507.15833","last_updated":"2026-07-13T23:45:05Z","snapshot_observed_at":"2026-08-06T15:20:06.611013Z","submitted_at":"2025-07-21T17:44:10Z","title":"Look, Focus, Act: Efficient and Robust Robot Learning via Human Gaze and Foveated Vision Transformers","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T15:26:24.814402Z"},"links":{"citing_paper":"/paper/2507.15833"},"observation_digest":"sha256:2c847fba2a65b8d74e8b35641dc5d27448321ae850a8bf59739c61580043b54d","observation_id":"77f10773-2874-44ed-b89f-4febcfb395da","resolution":{"observed_at":"2026-08-06T15:26:25.398050Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00482","last_updated":"2024-03-11T14:27:48Z","snapshot_observed_at":"2026-07-06T14:47:04.817434Z","submitted_at":"2023-02-01T14:47:17Z","title":"Improving and generalizing flow-based generative models with minibatch optimal transport","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00482","snapshot_observed_at":"2026-08-06T15:26:24.817423Z","title":"Improving and generalizing flow-based generative models with minibatch optimal transport,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15833","last_updated":"2026-07-13T23:45:05Z","snapshot_observed_at":"2026-08-06T15:20:06.611013Z","submitted_at":"2025-07-21T17:44:10Z","title":"Look, Focus, Act: Efficient and Robust Robot Learning via Human Gaze and Foveated Vision Transformers","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T15:26:24.817423Z"},"links":{"cited_paper":"/paper/2302.00482","citing_paper":"/paper/2507.15833"},"observation_digest":"sha256:4143bc66f81084bbfb497e66b019b06212676f4c12567df79637b70c1020c7e1","observation_id":"a05b25a7-80d9-4da6-91a4-00f8699dfb19","resolution":{"observed_at":"2026-08-06T15:26:24.817423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:26:24.820442Z","title":"Affordance-based robot manipulation with flow matching,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15833","last_updated":"2026-07-13T23:45:05Z","snapshot_observed_at":"2026-08-06T15:20:06.611013Z","submitted_at":"2025-07-21T17:44:10Z","title":"Look, Focus, Act: Efficient and Robust Robot Learning via Human Gaze and Foveated Vision Transformers","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T15:26:24.820442Z"},"links":{"citing_paper":"/paper/2507.15833"},"observation_digest":"sha256:5fdc16c53ecd5688023901bfeab1581df89de81a3146dca9ac27016efa6fa799","observation_id":"0f509454-2616-4c63-be45-7f611e147945","resolution":{"observed_at":"2026-08-06T15:26:24.820442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-02T18:24:58.914589Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-06T15:26:24.824013Z","title":"Flow matching for generative modeling,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.15833","last_updated":"2026-07-13T23:45:05Z","snapshot_observed_at":"2026-08-06T15:20:06.611013Z","submitted_at":"2025-07-21T17:44:10Z","title":"Look, Focus, Act: Efficient and Robust Robot Learning via Human Gaze and Foveated Vision Transformers","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T15:26:24.824013Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2507.15833"},"observation_digest":"sha256:5b2f998f835890b49bfc8ce1f9a3fe5448e42d77bfd45ea57f18f5d995e1d8bc","observation_id":"006f5ce2-f174-4492-a967-d330aec1a913","resolution":{"observed_at":"2026-08-06T15:26:24.824013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:26:24.827374Z","title":"Blip-2: Bootstrapping language- image pre-training with frozen image encoders and large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15833","last_updated":"2026-07-13T23:45:05Z","snapshot_observed_at":"2026-08-06T15:20:06.611013Z","submitted_at":"2025-07-21T17:44:10Z","title":"Look, Focus, Act: Efficient and Robust Robot Learning via Human Gaze and Foveated Vision Transformers","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T15:26:24.827374Z"},"links":{"citing_paper":"/paper/2507.15833"},"observation_digest":"sha256:23f9653e579014715b65b8286361a3b4627080023157d6d85e20592b4b458522","observation_id":"829c3ee5-503a-448c-95cb-91bae424411f","resolution":{"observed_at":"2026-08-06T15:26:24.827374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:26:24.830907Z","title":"Scalable diffusion models with transformers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15833","last_updated":"2026-07-13T23:45:05Z","snapshot_observed_at":"2026-08-06T15:20:06.611013Z","submitted_at":"2025-07-21T17:44:10Z","title":"Look, Focus, Act: Efficient and Robust Robot Learning via Human Gaze and Foveated Vision Transformers","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T15:26:24.830907Z"},"links":{"citing_paper":"/paper/2507.15833"},"observation_digest":"sha256:3bb2fd4894b955daef5f15cc9d293cbef743ed736306740fccafa823af0ec171","observation_id":"99343bc7-9761-41f6-9d8d-d17aae6e07e2","resolution":{"observed_at":"2026-08-06T15:26:24.830907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-06T15:26:24.834469Z","title":"Movie gen: A cast of media foundation models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15833","last_updated":"2026-07-13T23:45:05Z","snapshot_observed_at":"2026-08-06T15:20:06.611013Z","submitted_at":"2025-07-21T17:44:10Z","title":"Look, Focus, Act: Efficient and Robust Robot Learning via Human Gaze and Foveated Vision Transformers","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T15:26:24.834469Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2507.15833"},"observation_digest":"sha256:4aa6486d379195bbc511bdb5fe6a90095c546e64922501a4c623e6794a32e9df","observation_id":"28d675ee-7aec-49f7-9bc2-044a2206edf3","resolution":{"observed_at":"2026-08-06T15:26:24.834469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:26:24.837714Z","title":"Imagenet: A large-scale hierarchical image database,","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2507.15833","last_updated":"2026-07-13T23:45:05Z","snapshot_observed_at":"2026-08-06T15:20:06.611013Z","submitted_at":"2025-07-21T17:44:10Z","title":"Look, Focus, Act: Efficient and Robust Robot Learning via Human Gaze and Foveated Vision Transformers","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T15:26:24.837714Z"},"links":{"citing_paper":"/paper/2507.15833"},"observation_digest":"sha256:bf9a24ae679bb661e0b9e0dd1658ec219da259d7762efa7ede1cc8d1aa3ce24b","observation_id":"ebb6e3eb-131c-4335-aa2e-53f694833eeb","resolution":{"observed_at":"2026-08-06T15:26:24.837714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:26:24.845540Z","title":"Masked autoencoders are scalable vision learners,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.15833","last_updated":"2026-07-13T23:45:05Z","snapshot_observed_at":"2026-08-06T15:20:06.611013Z","submitted_at":"2025-07-21T17:44:10Z","title":"Look, Focus, Act: Efficient and Robust Robot Learning via Human Gaze and Foveated Vision Transformers","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T15:26:24.845540Z"},"links":{"citing_paper":"/paper/2507.15833"},"observation_digest":"sha256:8102be7688dbc5834a8324467b8f6c1c36ac159c593d3a9305273f8a748d6529","observation_id":"4e8816bd-ffcd-49f3-b1e1-9c38201f351c","resolution":{"observed_at":"2026-08-06T15:26:24.845540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.15833","last_updated":"2026-07-13T23:45:05Z","latest_version":3,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-06T15:20:06.611013Z","submitted_at":"2025-07-21T17:44:10Z","title":"Look, Focus, Act: Efficient and Robust Robot Learning via Human Gaze and Foveated Vision Transformers"},"reference_resolution":{"displayed":45,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":26,"verified_exact":1,"verified_fuzzy":18},"total_outbound_references":45},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 45 of 45 outbound references and 5 inbound Pith citation observations for arXiv:2507.15833."}