{"as_of":"2026-08-09T12:13:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f632ddfc0a776a1fcd4b100bbaf0dec2e01cc9e683ff890a93492b56c18b3a97","coverage":[{"denominator":53,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":53,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:14:25.475997Z","state":"measured"},{"denominator":53,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":53,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.02140/citation-record","integrity":"/paper/2608.02140/integrity","json":"/paper/2608.02140/citation-record.json","paper":"/paper/2608.02140"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:37.592826Z","title":"Salisa: Saliency-based input sampling for efficient video object detection, 2022","venue":null,"work_id":"2e546bee-edf2-4306-8f89-8bf9a605d8da","year":2022},"citing_paper":{"arxiv_id":"2608.02140","last_updated":"2026-08-05T14:57:15Z","snapshot_observed_at":"2026-08-08T23:13:07.050598Z","submitted_at":"2026-08-03T12:28:11Z","title":"HiResNets: Native Full-HD Video Recognition with Foveal Residual Streams","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:20.951252Z"},"links":{"citing_paper":"/paper/2608.02140"},"observation_digest":"sha256:e95c707b8a2e66f6cf373b02a756e1f341a5faeccd18c2eebc925a67dfba068e","observation_id":"39d93099-46e5-4adb-823c-7f465bd151f7","resolution":{"observed_at":"2026-08-07T00:14:37.769210Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:37.412094Z","title":"Token merging: Your vit but faster","venue":null,"work_id":"e3aa45da-08f4-489c-85a8-321d1c6dfe2a","year":2023},"citing_paper":{"arxiv_id":"2608.02140","last_updated":"2026-08-05T14:57:15Z","snapshot_observed_at":"2026-08-08T23:13:07.050598Z","submitted_at":"2026-08-03T12:28:11Z","title":"HiResNets: Native Full-HD Video Recognition with Foveal Residual Streams","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:21.027402Z"},"links":{"citing_paper":"/paper/2608.02140"},"observation_digest":"sha256:142088cc219313744bb17c052d1ad933bb69a3964d3d350b23f57f9d2fcf40a4","observation_id":"7371bb67-9e15-4476-bbf1-f3ae9e8f4d25","resolution":{"observed_at":"2026-08-07T00:14:37.483352Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:37.141440Z","title":"Visual attention: The past 25 years.Vision Research, 51(13):1484–1525, 2011","venue":null,"work_id":"70d07803-fcc3-4b78-9b62-12da63b121e6","year":2011},"citing_paper":{"arxiv_id":"2608.02140","last_updated":"2026-08-05T14:57:15Z","snapshot_observed_at":"2026-08-08T23:13:07.050598Z","submitted_at":"2026-08-03T12:28:11Z","title":"HiResNets: Native Full-HD Video Recognition with Foveal Residual Streams","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:21.123738Z"},"links":{"citing_paper":"/paper/2608.02140"},"observation_digest":"sha256:43b9e3f6e6b97b69566662bb128073ab7b939e151d1ee85d33a7cbf9c57851c8","observation_id":"eac8c0d0-25c0-4399-934e-411bec93e46f","resolution":{"observed_at":"2026-08-07T00:14:37.244452Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:36.741983Z","title":"Chen, Chengkuan Chen, Yicong Li, Tiffany Y","venue":null,"work_id":"7dc5922b-2f2e-4e8c-ab35-ec89f03be87f","year":2022},"citing_paper":{"arxiv_id":"2608.02140","last_updated":"2026-08-05T14:57:15Z","snapshot_observed_at":"2026-08-08T23:13:07.050598Z","submitted_at":"2026-08-03T12:28:11Z","title":"HiResNets: Native Full-HD Video Recognition with Foveal Residual Streams","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:21.223499Z"},"links":{"citing_paper":"/paper/2608.02140"},"observation_digest":"sha256:261e27f5d1d042a36c32cc8cfe0b82c02344bf09b3b1453ca9857b4d0d567402","observation_id":"8e55fd1f-2883-4bad-b668-a0c0d980f5ac","resolution":{"observed_at":"2026-08-07T00:14:36.971991Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:36.393814Z","title":"Training deep nets with sublinear memory cost, 2016","venue":null,"work_id":"4179e2fa-32c8-45f4-93dd-f52d6f3893d5","year":2016},"citing_paper":{"arxiv_id":"2608.02140","last_updated":"2026-08-05T14:57:15Z","snapshot_observed_at":"2026-08-08T23:13:07.050598Z","submitted_at":"2026-08-03T12:28:11Z","title":"HiResNets: Native Full-HD Video Recognition with Foveal Residual Streams","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:21.322402Z"},"links":{"citing_paper":"/paper/2608.02140"},"observation_digest":"sha256:80e218c9775777bacd9fdb552ef08fa497a00b9eec4fc5136d60ec6db789fe57","observation_id":"ab37e6f2-cda1-4be3-8fe8-4d5e84284aec","resolution":{"observed_at":"2026-08-07T00:14:36.545816Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:36.023958Z","title":"Dynamic convolution: At- tention over convolution kernels","venue":null,"work_id":"73d04184-e3b1-4bdb-a246-14f42ba4f0b2","year":2020},"citing_paper":{"arxiv_id":"2608.02140","last_updated":"2026-08-05T14:57:15Z","snapshot_observed_at":"2026-08-08T23:13:07.050598Z","submitted_at":"2026-08-03T12:28:11Z","title":"HiResNets: Native Full-HD Video Recognition with Foveal Residual Streams","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:21.401664Z"},"links":{"citing_paper":"/paper/2608.02140"},"observation_digest":"sha256:16c061a51f0267fd82f192bf35c6b3a3215ec8d010d0cc24b19101ac85c69ac1","observation_id":"4e4efe44-c4b1-418f-8de4-f793b2ebaff5","resolution":{"observed_at":"2026-08-07T00:14:36.187819Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:35.699371Z","title":"Curcio, Kenneth R","venue":null,"work_id":"80867c12-9414-4975-bfb5-2ffb0899f9f7","year":1990},"citing_paper":{"arxiv_id":"2608.02140","last_updated":"2026-08-05T14:57:15Z","snapshot_observed_at":"2026-08-08T23:13:07.050598Z","submitted_at":"2026-08-03T12:28:11Z","title":"HiResNets: Native Full-HD Video Recognition with Foveal Residual Streams","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:21.485707Z"},"links":{"citing_paper":"/paper/2608.02140"},"observation_digest":"sha256:d31c2a691513e42b95fec2cb736176ea915be1c167cbff1c4c76c17e9cd8d2a6","observation_id":"8c1489d9-7efb-4bbc-aee4-15778ab4b40b","resolution":{"observed_at":"2026-08-07T00:14:35.843112Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:35.536841Z","title":"Deformable convolutional networks","venue":null,"work_id":"ff7d8a49-abb7-4d5f-8acc-408c30d72438","year":2017},"citing_paper":{"arxiv_id":"2608.02140","last_updated":"2026-08-05T14:57:15Z","snapshot_observed_at":"2026-08-08T23:13:07.050598Z","submitted_at":"2026-08-03T12:28:11Z","title":"HiResNets: Native Full-HD Video Recognition with Foveal Residual Streams","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:21.562586Z"},"links":{"citing_paper":"/paper/2608.02140"},"observation_digest":"sha256:1741955450d27d4abc5628acbc2a72e63b8dea0fad0b66124d85799a070b88fe","observation_id":"bbc3331b-526e-4efb-a747-e1a30df9f91e","resolution":{"observed_at":"2026-08-07T00:14:35.623475Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:35.339221Z","title":"Scaling egocentric vision: The EPIC- KITCHENS dataset","venue":null,"work_id":"5060ca95-b3d6-40a6-913a-880e3c7b4c08","year":2018},"citing_paper":{"arxiv_id":"2608.02140","last_updated":"2026-08-05T14:57:15Z","snapshot_observed_at":"2026-08-08T23:13:07.050598Z","submitted_at":"2026-08-03T12:28:11Z","title":"HiResNets: Native Full-HD Video Recognition with Foveal Residual Streams","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:21.676508Z"},"links":{"citing_paper":"/paper/2608.02140"},"observation_digest":"sha256:0b3618da50f6aea3271422d8f064deb8ef3bb094956aa988445fa610b621e276","observation_id":"aeed5140-af3a-4f5e-8fc4-fe0547ef5a2e","resolution":{"observed_at":"2026-08-07T00:14:35.429545Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:21.755022Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.02140","last_updated":"2026-08-05T14:57:15Z","snapshot_observed_at":"2026-08-08T23:13:07.050598Z","submitted_at":"2026-08-03T12:28:11Z","title":"HiResNets: Native Full-HD Video Recognition with Foveal Residual Streams","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:21.755022Z"},"links":{"citing_paper":"/paper/2608.02140"},"observation_digest":"sha256:abf359beae5c180b821f383ae0db814608054b6b1fbf685b1016a02d3158588d","observation_id":"fb3a6f98-6ee0-4429-b273-f02eb5a4ba9f","resolution":{"observed_at":"2026-08-07T00:14:21.755022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:35.163327Z","title":"Saccader: Improving accuracy of hard attention models for vision","venue":null,"work_id":"0958558e-b605-4d96-8603-2320594fc32a","year":2019},"citing_paper":{"arxiv_id":"2608.02140","last_updated":"2026-08-05T14:57:15Z","snapshot_observed_at":"2026-08-08T23:13:07.050598Z","submitted_at":"2026-08-03T12:28:11Z","title":"HiResNets: Native Full-HD Video Recognition with Foveal Residual Streams","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:21.833199Z"},"links":{"citing_paper":"/paper/2608.02140"},"observation_digest":"sha256:aa213dbc727f5c69a77ed28af4d4087e1ea915b821804d4af8e21586f7312b75","observation_id":"9395121c-b384-4133-aa99-1c1172b33509","resolution":{"observed_at":"2026-08-07T00:14:35.231781Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:35.015868Z","title":"Polar transformer networks","venue":null,"work_id":"d696935d-1935-4c85-a9d0-4087112fa96d","year":2018},"citing_paper":{"arxiv_id":"2608.02140","last_updated":"2026-08-05T14:57:15Z","snapshot_observed_at":"2026-08-08T23:13:07.050598Z","submitted_at":"2026-08-03T12:28:11Z","title":"HiResNets: Native Full-HD Video Recognition with Foveal Residual Streams","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:21.909274Z"},"links":{"citing_paper":"/paper/2608.02140"},"observation_digest":"sha256:e6266d55188610c331d1e3f4d6ad406d673d50767e1819243b203718d98f9a61","observation_id":"13aaf446-b4ff-444e-9375-00f027406275","resolution":{"observed_at":"2026-08-07T00:14:35.070883Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:34.882197Z","title":"Multiscale vision transformers","venue":null,"work_id":"b89b3b4c-29cb-4ec4-bbe4-24d7a704c204","year":2021},"citing_paper":{"arxiv_id":"2608.02140","last_updated":"2026-08-05T14:57:15Z","snapshot_observed_at":"2026-08-08T23:13:07.050598Z","submitted_at":"2026-08-03T12:28:11Z","title":"HiResNets: Native Full-HD Video Recognition with Foveal Residual Streams","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:21.983151Z"},"links":{"citing_paper":"/paper/2608.02140"},"observation_digest":"sha256:6df126c1a33c95b6c860676e464a591134f2af87167734a4b6f0d4a34ccd7374","observation_id":"47062acf-e491-4b89-966f-1ff682b407df","resolution":{"observed_at":"2026-08-07T00:14:34.963873Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:34.584358Z","title":"Morariu, and Larry S","venue":null,"work_id":"27591842-f90d-4740-bdd1-e84ddd625157","year":2018},"citing_paper":{"arxiv_id":"2608.02140","last_updated":"2026-08-05T14:57:15Z","snapshot_observed_at":"2026-08-08T23:13:07.050598Z","submitted_at":"2026-08-03T12:28:11Z","title":"HiResNets: Native Full-HD Video Recognition with Foveal Residual Streams","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:22.097909Z"},"links":{"citing_paper":"/paper/2608.02140"},"observation_digest":"sha256:645b7167d76bdba01a29091405f9475b76236120d20d88b2c26ade801862356b","observation_id":"83e5f4f5-7d3d-4a7a-b19b-4493077aa3d8","resolution":{"observed_at":"2026-08-07T00:14:34.783277Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1905.03702","last_updated":"2019-05-17T16:18:02Z","snapshot_observed_at":"2026-08-01T20:55:40.805763Z","submitted_at":"2019-04-30T17:47:53Z","title":"OpenEDS: Open Eye Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.03702","snapshot_observed_at":"2026-08-07T00:14:22.145123Z","title":"Garbin, Yiru Shen, Dushyant Goodman, Jakob H","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2608.02140","last_updated":"2026-08-05T14:57:15Z","snapshot_observed_at":"2026-08-08T23:13:07.050598Z","submitted_at":"2026-08-03T12:28:11Z","title":"HiResNets: Native Full-HD Video Recognition with Foveal Residual Streams","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:22.145123Z"},"links":{"cited_paper":"/paper/1905.03702","citing_paper":"/paper/2608.02140"},"observation_digest":"sha256:b0c3d15d85e3f00f8df7019c6b2fbb78425acd72dec8b7e237d44c9e9f91454b","observation_id":"a24f6120-40b8-4f0d-8584-63efac4bcff8","resolution":{"observed_at":"2026-08-07T00:14:22.145123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:34.338915Z","title":"Ego4D: Around the world in 3,000 hours of egocentric video","venue":null,"work_id":"195f47f7-6667-4277-91ed-3f2e3a437103","year":2022},"citing_paper":{"arxiv_id":"2608.02140","last_updated":"2026-08-05T14:57:15Z","snapshot_observed_at":"2026-08-08T23:13:07.050598Z","submitted_at":"2026-08-03T12:28:11Z","title":"HiResNets: Native Full-HD Video Recognition with Foveal Residual Streams","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:22.262082Z"},"links":{"citing_paper":"/paper/2608.02140"},"observation_digest":"sha256:8c5a07b775bb5840c50ab791231a3215ecf6d129ae52881b2205ba9ef90673e6","observation_id":"71b26f88-9e5c-4b1d-b297-36512f30726f","resolution":{"observed_at":"2026-08-07T00:14:34.430055Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:34.087462Z","title":"Deep residual learning for image recognition","venue":null,"work_id":"f59bea94-7a29-49c6-a4aa-4bdd50e69099","year":2016},"citing_paper":{"arxiv_id":"2608.02140","last_updated":"2026-08-05T14:57:15Z","snapshot_observed_at":"2026-08-08T23:13:07.050598Z","submitted_at":"2026-08-03T12:28:11Z","title":"HiResNets: Native Full-HD Video Recognition with Foveal Residual Streams","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:22.366173Z"},"links":{"citing_paper":"/paper/2608.02140"},"observation_digest":"sha256:5557c4b00b4f2dbfad313f8b1973cd1760826cce3903f6c3a1d359c8965825b1","observation_id":"be3ba4d7-d811-44f3-9ea2-3b077756687d","resolution":{"observed_at":"2026-08-07T00:14:34.221649Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:33.794528Z","title":"Warped convolutions: Efficient invariance to spatial transformations","venue":null,"work_id":"cbac67eb-969c-4c3a-918b-d34c5511c8ee","year":2017},"citing_paper":{"arxiv_id":"2608.02140","last_updated":"2026-08-05T14:57:15Z","snapshot_observed_at":"2026-08-08T23:13:07.050598Z","submitted_at":"2026-08-03T12:28:11Z","title":"HiResNets: Native Full-HD Video Recognition with Foveal Residual Streams","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:22.483789Z"},"links":{"citing_paper":"/paper/2608.02140"},"observation_digest":"sha256:ee37447b928d1c3c313ae4d0b1b16d7ca9aa861364df2af6775f674f92cad2e1","observation_id":"5e31afb7-777c-4f4d-b0b3-20d082463b68","resolution":{"observed_at":"2026-08-07T00:14:33.930685Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:33.627264Z","title":"Spatial transformer networks","venue":null,"work_id":"4c804264-39e1-49b5-8526-d9cf496c53a1","year":2015},"citing_paper":{"arxiv_id":"2608.02140","last_updated":"2026-08-05T14:57:15Z","snapshot_observed_at":"2026-08-08T23:13:07.050598Z","submitted_at":"2026-08-03T12:28:11Z","title":"HiResNets: Native Full-HD Video Recognition with Foveal Residual Streams","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:22.556573Z"},"links":{"citing_paper":"/paper/2608.02140"},"observation_digest":"sha256:e2ca3e04f1702206aabdb027fdd2127e062763939d6722e4fbf05113c2207abd","observation_id":"dfaf410b-be17-4a34-bf95-20afb520e094","resolution":{"observed_at":"2026-08-07T00:14:33.691720Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:33.468880Z","title":"Ultralytics yolo11, 2024","venue":null,"work_id":"6b39e7e9-1283-4fa4-afef-9c5c28dcebcc","year":2024},"citing_paper":{"arxiv_id":"2608.02140","last_updated":"2026-08-05T14:57:15Z","snapshot_observed_at":"2026-08-08T23:13:07.050598Z","submitted_at":"2026-08-03T12:28:11Z","title":"HiResNets: Native Full-HD Video Recognition with Foveal Residual Streams","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:22.672709Z"},"links":{"citing_paper":"/paper/2608.02140"},"observation_digest":"sha256:ab7006c99be1dcbe2b3ef00d1b828715bb7b7ced93a76d41ad1ad4667ca90901","observation_id":"126d8551-2591-4ab8-a14f-0436d4746140","resolution":{"observed_at":"2026-08-07T00:14:33.553629Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.14173","last_updated":"2022-10-02T19:59:49Z","snapshot_observed_at":"2026-07-06T11:13:54.995111Z","submitted_at":"2021-05-29T01:54:33Z","title":"FoveaTer: Foveated Transformer for Image Classification","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.14173","snapshot_observed_at":"2026-08-07T00:14:22.743370Z","title":"Manjunath, and Miguel P","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02140","last_updated":"2026-08-05T14:57:15Z","snapshot_observed_at":"2026-08-08T23:13:07.050598Z","submitted_at":"2026-08-03T12:28:11Z","title":"HiResNets: Native Full-HD Video Recognition with Foveal Residual Streams","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:22.743370Z"},"links":{"cited_paper":"/paper/2105.14173","citing_paper":"/paper/2608.02140"},"observation_digest":"sha256:d3ace42379e399005fe57c2eb40454c3f64dfd6e875555c81d92fab032377dab","observation_id":"2f4d104b-5cf2-4d19-bca9-9b3b5da89ffa","resolution":{"observed_at":"2026-08-07T00:14:22.743370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:33.241961Z","title":"Gaze360: Physically uncon- strained gaze estimation in the wild","venue":null,"work_id":"b59360d1-4f3b-4bce-bb84-ae13325d0b38","year":2019},"citing_paper":{"arxiv_id":"2608.02140","last_updated":"2026-08-05T14:57:15Z","snapshot_observed_at":"2026-08-08T23:13:07.050598Z","submitted_at":"2026-08-03T12:28:11Z","title":"HiResNets: Native Full-HD Video Recognition with Foveal Residual Streams","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:22.822761Z"},"links":{"citing_paper":"/paper/2608.02140"},"observation_digest":"sha256:29291596c8717c3c5caeb893be88ddc702a3d2d5ecbf99b21d5f3ac888810c3c","observation_id":"72098f59-2090-4b60-878f-02888182699c","resolution":{"observed_at":"2026-08-07T00:14:33.330669Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:33.057273Z","title":"Paul Siebert","venue":null,"work_id":"729f376f-c24a-457a-8277-56c545a7cb01","year":2022},"citing_paper":{"arxiv_id":"2608.02140","last_updated":"2026-08-05T14:57:15Z","snapshot_observed_at":"2026-08-08T23:13:07.050598Z","submitted_at":"2026-08-03T12:28:11Z","title":"HiResNets: Native Full-HD Video Recognition with Foveal Residual Streams","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:22.895006Z"},"links":{"citing_paper":"/paper/2608.02140"},"observation_digest":"sha256:9f0d5c26cc56bded89501c5f138f4c505b321070a2feb9eeea44bcdb479ef46e","observation_id":"ed33294c-e00f-4126-9bfd-93aac9518441","resolution":{"observed_at":"2026-08-07T00:14:33.155273Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:32.911921Z","title":"Foveation in the era of deep learn- ing","venue":null,"work_id":"82518bea-bbf2-4f4a-be67-3a3d27b48576","year":2023},"citing_paper":{"arxiv_id":"2608.02140","last_updated":"2026-08-05T14:57:15Z","snapshot_observed_at":"2026-08-08T23:13:07.050598Z","submitted_at":"2026-08-03T12:28:11Z","title":"HiResNets: Native Full-HD Video Recognition with Foveal Residual Streams","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:22.967801Z"},"links":{"citing_paper":"/paper/2608.02140"},"observation_digest":"sha256:0bb2515173e5afaeeacbeb4f79077cdf60035f7ca752a9d72bc6d0b13031b7f0","observation_id":"4434ea8e-e5ea-4ce9-8ae5-722bbed35667","resolution":{"observed_at":"2026-08-07T00:14:32.978588Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:32.734018Z","title":"In the eye of transformer: Global–local correlation for egocentric gaze estimation and beyond.International Journal of Com- puter Vision, pages 1–18, 2023","venue":null,"work_id":"00c3bb4e-24bf-4c68-a372-639f1a9db232","year":2023},"citing_paper":{"arxiv_id":"2608.02140","last_updated":"2026-08-05T14:57:15Z","snapshot_observed_at":"2026-08-08T23:13:07.050598Z","submitted_at":"2026-08-03T12:28:11Z","title":"HiResNets: Native Full-HD Video Recognition with Foveal Residual Streams","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:23.003262Z"},"links":{"citing_paper":"/paper/2608.02140"},"observation_digest":"sha256:0d2227eb74f39c76ec7023673d3a5088ec91df5977b438fe455c2866bbad1efc","observation_id":"3692e6b0-1315-4253-b8a9-5c081ca02365","resolution":{"observed_at":"2026-08-07T00:14:32.812219Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:32.536307Z","title":"Learning to combine foveal glimpses with a third-order boltzmann ma- chine","venue":null,"work_id":"a29af629-550e-4049-8641-016615c1512e","year":2010},"citing_paper":{"arxiv_id":"2608.02140","last_updated":"2026-08-05T14:57:15Z","snapshot_observed_at":"2026-08-08T23:13:07.050598Z","submitted_at":"2026-08-03T12:28:11Z","title":"HiResNets: Native Full-HD Video Recognition with Foveal Residual Streams","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:23.079261Z"},"links":{"citing_paper":"/paper/2608.02140"},"observation_digest":"sha256:05ac64e01fc3ed86cf48b086388d8ece836aaf5d241ee59f97d58ca0adba2d98","observation_id":"0241eea4-9a19-4c05-bc27-5d31da85355c","resolution":{"observed_at":"2026-08-07T00:14:32.632498Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:32.330872Z","title":"Froehlich, Yuhang Zhao, and Yapeng Tian","venue":null,"work_id":"f0dfb28b-7a55-4436-a5e9-d0b30d5f9526","year":2026},"citing_paper":{"arxiv_id":"2608.02140","last_updated":"2026-08-05T14:57:15Z","snapshot_observed_at":"2026-08-08T23:13:07.050598Z","submitted_at":"2026-08-03T12:28:11Z","title":"HiResNets: Native Full-HD Video Recognition with Foveal Residual Streams","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:23.155844Z"},"links":{"citing_paper":"/paper/2608.02140"},"observation_digest":"sha256:0c0be867bca1cd24ab0ffc66328412bb3d6ae91b6943b3cd4b9cc80e5f4fc7fb","observation_id":"e4ec6a0c-f81e-4e0c-9a00-d23503c2c0ec","resolution":{"observed_at":"2026-08-07T00:14:32.403055Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:32.142665Z","title":null,"venue":null,"work_id":"bc7f4d30-9820-4135-a00c-c689b1a7f58f","year":null},"citing_paper":{"arxiv_id":"2608.02140","last_updated":"2026-08-05T14:57:15Z","snapshot_observed_at":"2026-08-08T23:13:07.050598Z","submitted_at":"2026-08-03T12:28:11Z","title":"HiResNets: Native Full-HD Video Recognition with Foveal Residual Streams","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:23.242020Z"},"links":{"citing_paper":"/paper/2608.02140"},"observation_digest":"sha256:132e3e12cdf4b595fb0d652a6a128b189fa3c41a38d38dec6adcb2f847ee12da","observation_id":"2c92cd68-272b-4c0c-8fe9-077fc29ce6e7","resolution":{"observed_at":"2026-08-07T00:14:32.227705Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:31.973758Z","title":"MViTv2: Improved multiscale vision transformers for classification and detection","venue":null,"work_id":"70ebe99e-31b5-4d18-bbbf-992fe54b01a9","year":2022},"citing_paper":{"arxiv_id":"2608.02140","last_updated":"2026-08-05T14:57:15Z","snapshot_observed_at":"2026-08-08T23:13:07.050598Z","submitted_at":"2026-08-03T12:28:11Z","title":"HiResNets: Native Full-HD Video Recognition with Foveal Residual Streams","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:23.309978Z"},"links":{"citing_paper":"/paper/2608.02140"},"observation_digest":"sha256:066811fa0f1de88b0c9746fb25a2010501ff150a724a0e70cbc77a022a7a783a","observation_id":"15cb780a-a20f-4a38-9c83-1a57dc20e3b0","resolution":{"observed_at":"2026-08-07T00:14:32.053321Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:31.752741Z","title":"Evit: Expediting vision transform- ers via token reorganizations","venue":null,"work_id":"8d0faaf8-d600-454c-a939-a2d8470eda98","year":2022},"citing_paper":{"arxiv_id":"2608.02140","last_updated":"2026-08-05T14:57:15Z","snapshot_observed_at":"2026-08-08T23:13:07.050598Z","submitted_at":"2026-08-03T12:28:11Z","title":"HiResNets: Native Full-HD Video Recognition with Foveal Residual Streams","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:23.433143Z"},"links":{"citing_paper":"/paper/2608.02140"},"observation_digest":"sha256:151881f63473271c71e32d0ee53cb5392da83ce86822e74b65bca7271f2dc069","observation_id":"b7ffbddd-e7b2-4bd1-88fe-474e826a9b7d","resolution":{"observed_at":"2026-08-07T00:14:31.884586Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:31.611840Z","title":"Girshick, Kaiming He, Bharath Hariharan, and Serge Belongie","venue":null,"work_id":"c374199e-515c-4cfb-8cbe-697741f0c542","year":2017},"citing_paper":{"arxiv_id":"2608.02140","last_updated":"2026-08-05T14:57:15Z","snapshot_observed_at":"2026-08-08T23:13:07.050598Z","submitted_at":"2026-08-03T12:28:11Z","title":"HiResNets: Native Full-HD Video Recognition with Foveal Residual Streams","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:23.540219Z"},"links":{"citing_paper":"/paper/2608.02140"},"observation_digest":"sha256:c0d65723f4f2890df47b328e894fd21fdf37642ed07a96b4fae8e83e161dd9bb","observation_id":"e3241e3b-6f3a-44fd-9928-e8cd3f7f696b","resolution":{"observed_at":"2026-08-07T00:14:31.689385Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:31.458277Z","title":"Girshick, Kaiming He, and Piotr Doll ´ar","venue":null,"work_id":"3e1eba3a-5fc7-44d8-8a7e-34daa7660911","year":2017},"citing_paper":{"arxiv_id":"2608.02140","last_updated":"2026-08-05T14:57:15Z","snapshot_observed_at":"2026-08-08T23:13:07.050598Z","submitted_at":"2026-08-03T12:28:11Z","title":"HiResNets: Native Full-HD Video Recognition with Foveal Residual Streams","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:23.635662Z"},"links":{"citing_paper":"/paper/2608.02140"},"observation_digest":"sha256:8ca80868ccaf6f12babfcadd3627817e2e637d347989ff3ddbe420d395cbd797","observation_id":"e7f178be-44bc-435f-ac49-26f3b25739af","resolution":{"observed_at":"2026-08-07T00:14:31.543154Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:31.275240Z","title":"A convnet for the 2020s","venue":null,"work_id":"8d0ab1e1-1d14-43fe-adc5-a5ed4ae85e46","year":2022},"citing_paper":{"arxiv_id":"2608.02140","last_updated":"2026-08-05T14:57:15Z","snapshot_observed_at":"2026-08-08T23:13:07.050598Z","submitted_at":"2026-08-03T12:28:11Z","title":"HiResNets: Native Full-HD Video Recognition with Foveal Residual Streams","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:23.720590Z"},"links":{"citing_paper":"/paper/2608.02140"},"observation_digest":"sha256:68e594f31fbfc97c532648ad528a114428b14969e6e856f0ab371dbaffd0ba9c","observation_id":"0f180f9d-e91e-454e-a8e9-1e0211c22524","resolution":{"observed_at":"2026-08-07T00:14:31.362054Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:31.135422Z","title":"Lu, Drew F.K","venue":null,"work_id":"d1a97704-a9d7-4e1b-bc46-9a960871cc19","year":2021},"citing_paper":{"arxiv_id":"2608.02140","last_updated":"2026-08-05T14:57:15Z","snapshot_observed_at":"2026-08-08T23:13:07.050598Z","submitted_at":"2026-08-03T12:28:11Z","title":"HiResNets: Native Full-HD Video Recognition with Foveal Residual Streams","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:23.826397Z"},"links":{"citing_paper":"/paper/2608.02140"},"observation_digest":"sha256:c485d8819cd2f003687807d651c8a4addf0ab307774f9eb991e7ed502275123e","observation_id":"fedd34f5-5a76-4943-a430-6e10aa4b66ca","resolution":{"observed_at":"2026-08-07T00:14:31.201423Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:30.869112Z","title":"Kernel foveated rendering.Proceedings of the ACM on Computer Graphics and Interactive Techniques, 1: 1–20, 2018","venue":null,"work_id":"62de0b64-ff07-4108-8609-f7776ccf71c3","year":2018},"citing_paper":{"arxiv_id":"2608.02140","last_updated":"2026-08-05T14:57:15Z","snapshot_observed_at":"2026-08-08T23:13:07.050598Z","submitted_at":"2026-08-03T12:28:11Z","title":"HiResNets: Native Full-HD Video Recognition with Foveal Residual Streams","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:23.920984Z"},"links":{"citing_paper":"/paper/2608.02140"},"observation_digest":"sha256:0153545e3564943e4e0b0bef8b4b0c62eb025636136847ba23938534d485e8a0","observation_id":"33b08386-29dc-48b0-a385-6a2ba6d0fb52","resolution":{"observed_at":"2026-08-07T00:14:30.995159Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:30.491278Z","title":"Recurrent models of visual attention","venue":null,"work_id":"7bf7c87c-9c1e-4134-a5e1-a1e68b921051","year":2014},"citing_paper":{"arxiv_id":"2608.02140","last_updated":"2026-08-05T14:57:15Z","snapshot_observed_at":"2026-08-08T23:13:07.050598Z","submitted_at":"2026-08-03T12:28:11Z","title":"HiResNets: Native Full-HD Video Recognition with Foveal Residual Streams","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:24.029957Z"},"links":{"citing_paper":"/paper/2608.02140"},"observation_digest":"sha256:84dbb1e402933fda0f89ac9cd70a58de24f3c2a6a1272fbd8357c1afcbb6727b","observation_id":"ff18f448-aa79-4cab-9e66-261af40602f5","resolution":{"observed_at":"2026-08-07T00:14:30.685812Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:30.129602Z","title":"Emergence of Fixational and Saccadic Movements in a Multi-level Recurrent Attention Model for Vision, page 299–313","venue":null,"work_id":"c3cbae29-96cc-4d3c-b396-4b862f3430d7","year":2025},"citing_paper":{"arxiv_id":"2608.02140","last_updated":"2026-08-05T14:57:15Z","snapshot_observed_at":"2026-08-08T23:13:07.050598Z","submitted_at":"2026-08-03T12:28:11Z","title":"HiResNets: Native Full-HD Video Recognition with Foveal Residual Streams","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:24.107892Z"},"links":{"citing_paper":"/paper/2608.02140"},"observation_digest":"sha256:c7aed9f420f2c58c4d4be38eebf4910856cacadcb7a24ef5bc159b90c91fe266","observation_id":"ac8d7524-8875-4f3d-9d42-1b4fbcbc382c","resolution":{"observed_at":"2026-08-07T00:14:30.300661Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:29.795095Z","title":"HD-EPIC: A highly-detailed egocentric video dataset","venue":null,"work_id":"77370a29-7ea7-4d28-b058-525025b19fac","year":2025},"citing_paper":{"arxiv_id":"2608.02140","last_updated":"2026-08-05T14:57:15Z","snapshot_observed_at":"2026-08-08T23:13:07.050598Z","submitted_at":"2026-08-03T12:28:11Z","title":"HiResNets: Native Full-HD Video Recognition with Foveal Residual Streams","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:24.202937Z"},"links":{"citing_paper":"/paper/2608.02140"},"observation_digest":"sha256:a4d8ceb6fe16ece9d296f3fd85b81d77d70c841c567afbf3170dc2ced77ddbcb","observation_id":"e065e806-7898-4141-8205-cc68bf2a2067","resolution":{"observed_at":"2026-08-07T00:14:29.941475Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:29.427626Z","title":"Paco: Parts and attributes of common objects","venue":null,"work_id":"1d501749-3e47-46eb-bb14-a7e99e170102","year":2023},"citing_paper":{"arxiv_id":"2608.02140","last_updated":"2026-08-05T14:57:15Z","snapshot_observed_at":"2026-08-08T23:13:07.050598Z","submitted_at":"2026-08-03T12:28:11Z","title":"HiResNets: Native Full-HD Video Recognition with Foveal Residual Streams","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:24.294641Z"},"links":{"citing_paper":"/paper/2608.02140"},"observation_digest":"sha256:8a8326494dcc518b7e843d19ebb192b3b1cd63a870f7ddcb5909b3cc06761583","observation_id":"3f351fb0-bc66-4de5-b5ce-2227d6e20bb7","resolution":{"observed_at":"2026-08-07T00:14:29.635077Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:29.070024Z","title":"Dynamicvit: Efficient vision transformers with dynamic token sparsification","venue":null,"work_id":"56cd4a88-8080-484e-b6c6-fde4ca34bc8a","year":2021},"citing_paper":{"arxiv_id":"2608.02140","last_updated":"2026-08-05T14:57:15Z","snapshot_observed_at":"2026-08-08T23:13:07.050598Z","submitted_at":"2026-08-03T12:28:11Z","title":"HiResNets: Native Full-HD Video Recognition with Foveal Residual Streams","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:24.336273Z"},"links":{"citing_paper":"/paper/2608.02140"},"observation_digest":"sha256:ad12e3c2b7ec4b6815bd43db91cee05177c395eea94869d5ff0cfe38bef593be","observation_id":"ec429570-7118-4378-b905-a066fd5693ba","resolution":{"observed_at":"2026-08-07T00:14:29.206461Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:28.753545Z","title":"Learning to zoom: a saliency- based sampling layer for neural networks","venue":null,"work_id":"6e74ae7c-bd35-45d8-8909-3a15a2d41984","year":2018},"citing_paper":{"arxiv_id":"2608.02140","last_updated":"2026-08-05T14:57:15Z","snapshot_observed_at":"2026-08-08T23:13:07.050598Z","submitted_at":"2026-08-03T12:28:11Z","title":"HiResNets: Native Full-HD Video Recognition with Foveal Residual Streams","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:24.459371Z"},"links":{"citing_paper":"/paper/2608.02140"},"observation_digest":"sha256:8f63c8b04c896b18fdf6c7ebf8d65c6a68900535bec8a8bb13a377bcacf4137a","observation_id":"96f2650a-f6e8-4c54-8a2b-e71a664c8106","resolution":{"observed_at":"2026-08-07T00:14:28.928567Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:28.448565Z","title":"Balas, and Livia Ilie","venue":null,"work_id":"048305d8-0700-459c-a025-237ff37c4379","year":2012},"citing_paper":{"arxiv_id":"2608.02140","last_updated":"2026-08-05T14:57:15Z","snapshot_observed_at":"2026-08-08T23:13:07.050598Z","submitted_at":"2026-08-03T12:28:11Z","title":"HiResNets: Native Full-HD Video Recognition with Foveal Residual Streams","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:24.532310Z"},"links":{"citing_paper":"/paper/2608.02140"},"observation_digest":"sha256:86d976a4689d98cd391f4fbed713c123b5b72471a5e8e1548e32e971b6096f3d","observation_id":"8b646702-65d9-4c50-a742-3806c6e15836","resolution":{"observed_at":"2026-08-07T00:14:28.599325Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:28.149671Z","title":"Schwartz","venue":null,"work_id":"774c7e22-1c12-4323-842e-6c25a09e75cb","year":1977},"citing_paper":{"arxiv_id":"2608.02140","last_updated":"2026-08-05T14:57:15Z","snapshot_observed_at":"2026-08-08T23:13:07.050598Z","submitted_at":"2026-08-03T12:28:11Z","title":"HiResNets: Native Full-HD Video Recognition with Foveal Residual Streams","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:24.617529Z"},"links":{"citing_paper":"/paper/2608.02140"},"observation_digest":"sha256:fe0a1e71b064fa0c5aef5785b3c866561fac7644595f48f09edd5a67c3b1e938","observation_id":"92678975-17b9-4c24-af5e-12be641dbff4","resolution":{"observed_at":"2026-08-07T00:14:28.302471Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:27.825036Z","title":"Computational anatomy and functional ar- chitecture of striate cortex: A spatial mapping approach to perceptual coding.Vision Research, 20(8):645–669, 1980","venue":null,"work_id":"608c7187-8d11-4e82-b8b9-ffeadef26581","year":1980},"citing_paper":{"arxiv_id":"2608.02140","last_updated":"2026-08-05T14:57:15Z","snapshot_observed_at":"2026-08-08T23:13:07.050598Z","submitted_at":"2026-08-03T12:28:11Z","title":"HiResNets: Native Full-HD Video Recognition with Foveal Residual Streams","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:24.706436Z"},"links":{"citing_paper":"/paper/2608.02140"},"observation_digest":"sha256:76bd1dc0f0a9d82a0ab97f6de7324f2544445f77c591bd476a67a23d5bd89919","observation_id":"2a9d3fd1-3180-4605-961c-eea389224cac","resolution":{"observed_at":"2026-08-07T00:14:27.985650Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:27.565231Z","title":"Pe- ripheral vision and pattern recognition: A review.Journal of Vision, 11(5):13–13, 2011","venue":null,"work_id":"3f3181dd-8790-4074-85ac-865f52115acb","year":2011},"citing_paper":{"arxiv_id":"2608.02140","last_updated":"2026-08-05T14:57:15Z","snapshot_observed_at":"2026-08-08T23:13:07.050598Z","submitted_at":"2026-08-03T12:28:11Z","title":"HiResNets: Native Full-HD Video Recognition with Foveal Residual Streams","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:24.789771Z"},"links":{"citing_paper":"/paper/2608.02140"},"observation_digest":"sha256:77f1936a0ba788273d6d739db2e7aa326fdabf9e3d0843d134cedae203a973a1","observation_id":"0fe5a730-c599-4c23-b656-823401d96121","resolution":{"observed_at":"2026-08-07T00:14:27.709046Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:27.256846Z","title":"Log-polar space convolution lay- ers","venue":null,"work_id":"ccc293e5-e61e-45a5-a321-1c804d52c248","year":null},"citing_paper":{"arxiv_id":"2608.02140","last_updated":"2026-08-05T14:57:15Z","snapshot_observed_at":"2026-08-08T23:13:07.050598Z","submitted_at":"2026-08-03T12:28:11Z","title":"HiResNets: Native Full-HD Video Recognition with Foveal Residual Streams","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:24.865466Z"},"links":{"citing_paper":"/paper/2608.02140"},"observation_digest":"sha256:7651cd5defb5de057afa86d5b8dabafb133b456191d19441fdda070a7b19da6f","observation_id":"9994b6b6-0b04-484f-aca7-31710e3a1298","resolution":{"observed_at":"2026-08-07T00:14:27.406001Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:26.856150Z","title":"Deep high-resolution representation learning for human pose es- timation","venue":null,"work_id":"8cbd5668-708f-4f54-9022-92e6c4c32093","year":2019},"citing_paper":{"arxiv_id":"2608.02140","last_updated":"2026-08-05T14:57:15Z","snapshot_observed_at":"2026-08-08T23:13:07.050598Z","submitted_at":"2026-08-03T12:28:11Z","title":"HiResNets: Native Full-HD Video Recognition with Foveal Residual Streams","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:24.953238Z"},"links":{"citing_paper":"/paper/2608.02140"},"observation_digest":"sha256:d428089be5145a2a68dac02853eb8787121b678cb635060b26313718f0354018","observation_id":"327c75ef-e13c-4eda-9958-f05453cf3e3f","resolution":{"observed_at":"2026-08-07T00:14:27.043632Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:26.610950Z","title":"Fovea: Foveated image magnification for autonomous navigation","venue":null,"work_id":"ab701c68-3d77-40f4-9252-ec7e835e7fe7","year":2021},"citing_paper":{"arxiv_id":"2608.02140","last_updated":"2026-08-05T14:57:15Z","snapshot_observed_at":"2026-08-08T23:13:07.050598Z","submitted_at":"2026-08-03T12:28:11Z","title":"HiResNets: Native Full-HD Video Recognition with Foveal Residual Streams","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:25.043179Z"},"links":{"citing_paper":"/paper/2608.02140"},"observation_digest":"sha256:84c6d9e4f7553b25cc5741b3b62807d653de7cdc07dddd98042893b8c075b43b","observation_id":"49b6ce86-6ca3-4eec-8c47-b5fe7a86fa67","resolution":{"observed_at":"2026-08-07T00:14:26.723006Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:26.377304Z","title":"Deep high-resolution representation learning for visual recogni- tion.IEEE Transactions on Pattern Analysis and Machine Intelligence, 2020","venue":null,"work_id":"971d641c-78a6-4c6b-8a58-6ac424c3ae8d","year":2020},"citing_paper":{"arxiv_id":"2608.02140","last_updated":"2026-08-05T14:57:15Z","snapshot_observed_at":"2026-08-08T23:13:07.050598Z","submitted_at":"2026-08-03T12:28:11Z","title":"HiResNets: Native Full-HD Video Recognition with Foveal Residual Streams","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:25.129879Z"},"links":{"citing_paper":"/paper/2608.02140"},"observation_digest":"sha256:475023d7ef8ff244efdb153bf9da05c4f196ab194999a69ed3107789630648f9","observation_id":"21d68452-2754-4745-b195-54f7aa0ff2e2","resolution":{"observed_at":"2026-08-07T00:14:26.465187Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:26.114420Z","title":"Zoom-in-net: Deep mining lesions for diabetic retinopathy detection","venue":null,"work_id":"e5d9de47-ebac-400f-b2d4-6e14cd20e407","year":2017},"citing_paper":{"arxiv_id":"2608.02140","last_updated":"2026-08-05T14:57:15Z","snapshot_observed_at":"2026-08-08T23:13:07.050598Z","submitted_at":"2026-08-03T12:28:11Z","title":"HiResNets: Native Full-HD Video Recognition with Foveal Residual Streams","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:25.216947Z"},"links":{"citing_paper":"/paper/2608.02140"},"observation_digest":"sha256:671c9585b6ac2e26093e1f56358fd0d536f8bd3dfa7a376e38c333930751d36d","observation_id":"8f825579-1807-4f51-a452-704300cfe8ec","resolution":{"observed_at":"2026-08-07T00:14:26.232723Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:25.825610Z","title":"No time to waste: Squeeze time into channel for mobile video understanding, 2024","venue":null,"work_id":"52886608-68f2-4e83-ab8d-aa82ddf1a0c6","year":2024},"citing_paper":{"arxiv_id":"2608.02140","last_updated":"2026-08-05T14:57:15Z","snapshot_observed_at":"2026-08-08T23:13:07.050598Z","submitted_at":"2026-08-03T12:28:11Z","title":"HiResNets: Native Full-HD Video Recognition with Foveal Residual Streams","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:25.310296Z"},"links":{"citing_paper":"/paper/2608.02140"},"observation_digest":"sha256:12f9347e217aaa5faab04171df1ff25fd7127059d9c8cb23752fd22784c4ebaf","observation_id":"6eee9076-2884-4171-9aaf-f193a5da1034","resolution":{"observed_at":"2026-08-07T00:14:25.959130Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:25.393751Z","title":"MPIIGaze: Real-world dataset and deep appearance-based gaze estimation.IEEE Transactions on Pattern Analysis and Machine Intelligence, 41(1):162–175,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02140","last_updated":"2026-08-05T14:57:15Z","snapshot_observed_at":"2026-08-08T23:13:07.050598Z","submitted_at":"2026-08-03T12:28:11Z","title":"HiResNets: Native Full-HD Video Recognition with Foveal Residual Streams","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:25.393751Z"},"links":{"citing_paper":"/paper/2608.02140"},"observation_digest":"sha256:c308323a472c5ff95bfed4d7d8e48bab687f22a7030b1d7e6f2468911bc6c899","observation_id":"bd9224c3-19bf-49e1-b84a-18e43c68e664","resolution":{"observed_at":"2026-08-07T00:14:25.393751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:25.591727Z","title":"ETH-XGaze: A large scale dataset for gaze estimation under extreme head pose and gaze variation","venue":null,"work_id":"f34ee688-a7fa-482a-84ba-56e90b67ed04","year":2020},"citing_paper":{"arxiv_id":"2608.02140","last_updated":"2026-08-05T14:57:15Z","snapshot_observed_at":"2026-08-08T23:13:07.050598Z","submitted_at":"2026-08-03T12:28:11Z","title":"HiResNets: Native Full-HD Video Recognition with Foveal Residual Streams","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:25.475997Z"},"links":{"citing_paper":"/paper/2608.02140"},"observation_digest":"sha256:9d4a8767693edfe3acd752b494b2a4988eea065b33a4a1d33d49efbef320c153","observation_id":"f239ae06-776a-43e5-ac3c-b9b8219b9e61","resolution":{"observed_at":"2026-08-07T00:14:25.689069Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.02140","last_updated":"2026-08-05T14:57:15Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T23:13:07.050598Z","submitted_at":"2026-08-03T12:28:11Z","title":"HiResNets: Native Full-HD Video Recognition with Foveal Residual Streams"},"reference_resolution":{"displayed":53,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":5,"verified_exact":0,"verified_fuzzy":48},"total_outbound_references":53},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 53 of 53 outbound references and 0 inbound Pith citation observations for arXiv:2608.02140."}