{"as_of":"2026-08-10T18:49:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:40db4052a50063e91cae9bcf7b7203d65866b6103e5fb23ecf9da784c53b9c49","coverage":[{"denominator":25,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":25,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:59:06.328656Z","state":"measured"},{"denominator":25,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":25,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.00827/citation-record","integrity":"/paper/2506.00827/integrity","json":"/paper/2506.00827/citation-record.json","paper":"/paper/2506.00827"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:59:10.081700Z","title":"Introducing hot3d: An egocentric dataset for 3d hand and object tracking, 2024","venue":null,"work_id":"1a1ad791-30ff-494d-9fd6-afaf29ca2bbf","year":2024},"citing_paper":{"arxiv_id":"2506.00827","last_updated":"2025-06-01T04:22:02Z","snapshot_observed_at":"2026-08-10T08:13:07.260920Z","submitted_at":"2025-06-01T04:22:02Z","title":"Improving Keystep Recognition in Ego-Video via Dexterous Focus","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T11:59:03.398227Z"},"links":{"citing_paper":"/paper/2506.00827"},"observation_digest":"sha256:8425611bcfe6fd9156d9998b9c0dfc4dacfd5d3368666afea6511c9c9a02d72e","observation_id":"3abed9b5-24a3-452f-9d78-d2c639b88a83","resolution":{"observed_at":"2026-08-07T11:59:10.167863Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:59:09.828266Z","title":"Is space-time attention all you need for video understanding? In Proceedings of the International Conference on Machine Learning (ICML), 2021","venue":null,"work_id":"936e19d5-34e3-4d19-a7d5-55c665fe020e","year":2021},"citing_paper":{"arxiv_id":"2506.00827","last_updated":"2025-06-01T04:22:02Z","snapshot_observed_at":"2026-08-10T08:13:07.260920Z","submitted_at":"2025-06-01T04:22:02Z","title":"Improving Keystep Recognition in Ego-Video via Dexterous Focus","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T11:59:03.487431Z"},"links":{"citing_paper":"/paper/2506.00827"},"observation_digest":"sha256:5d99810fea10a6199c04e1becb88d8116b829b72251c65a84213dc5faded4b65","observation_id":"3e4ffd7f-5cf5-4159-a741-d0c9a61e8198","resolution":{"observed_at":"2026-08-07T11:59:09.936909Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:59:09.573435Z","title":"A dense-sparse complementary network for human ac- tion recognition based on rgb and skeleton modalities.Expert Systems with Applications, 244:123061, 2024","venue":null,"work_id":"e3dcc7da-97a1-46f6-aed2-22981cb5a27a","year":2024},"citing_paper":{"arxiv_id":"2506.00827","last_updated":"2025-06-01T04:22:02Z","snapshot_observed_at":"2026-08-10T08:13:07.260920Z","submitted_at":"2025-06-01T04:22:02Z","title":"Improving Keystep Recognition in Ego-Video via Dexterous Focus","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T11:59:03.617735Z"},"links":{"citing_paper":"/paper/2506.00827"},"observation_digest":"sha256:11b296abce7c6093fea35ff30eb7e058a3fb90762cfd701ab1bb4b4e2be509bf","observation_id":"cd0d9544-8ffb-4cc7-b313-fee242e9d6d8","resolution":{"observed_at":"2026-08-07T11:59:09.728003Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:59:09.329849Z","title":"Rescaling egocentric vision: Collection, pipeline and challenges for epic-kitchens-100","venue":null,"work_id":"14f5dba5-44f0-4148-932c-517e36d5d97c","year":2022},"citing_paper":{"arxiv_id":"2506.00827","last_updated":"2025-06-01T04:22:02Z","snapshot_observed_at":"2026-08-10T08:13:07.260920Z","submitted_at":"2025-06-01T04:22:02Z","title":"Improving Keystep Recognition in Ego-Video via Dexterous Focus","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T11:59:03.727388Z"},"links":{"citing_paper":"/paper/2506.00827"},"observation_digest":"sha256:2f9e41548798ee878e7114cfbfa40ae3baba82cba4d3a3aeeb18f07d82826604","observation_id":"d01aa204-5528-421e-970c-266d7a7ec5b4","resolution":{"observed_at":"2026-08-07T11:59:09.409102Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:59:09.085555Z","title":"Activitynet: A large-scale video bench- mark for human activity understanding","venue":null,"work_id":"6d3f7f58-b7ef-43ac-93ad-07f7780eb841","year":2015},"citing_paper":{"arxiv_id":"2506.00827","last_updated":"2025-06-01T04:22:02Z","snapshot_observed_at":"2026-08-10T08:13:07.260920Z","submitted_at":"2025-06-01T04:22:02Z","title":"Improving Keystep Recognition in Ego-Video via Dexterous Focus","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T11:59:03.863529Z"},"links":{"citing_paper":"/paper/2506.00827"},"observation_digest":"sha256:405169ed91831e7de056416bab9426861c6ef747f989b220918acdb066d1014c","observation_id":"55c20920-77fb-49d5-9731-6115f10a76eb","resolution":{"observed_at":"2026-08-07T11:59:09.175037Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:59:03.974014Z","title":"The” something something” video database for learning and evaluating visual common sense","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.00827","last_updated":"2025-06-01T04:22:02Z","snapshot_observed_at":"2026-08-10T08:13:07.260920Z","submitted_at":"2025-06-01T04:22:02Z","title":"Improving Keystep Recognition in Ego-Video via Dexterous Focus","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T11:59:03.974014Z"},"links":{"citing_paper":"/paper/2506.00827"},"observation_digest":"sha256:ff75373e206e9781a338d3a73063a4a04571f655026ec48376fb87b90f327b99","observation_id":"d53db83b-735f-422f-9d84-18dc87ed6150","resolution":{"observed_at":"2026-08-07T11:59:03.974014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:59:08.875879Z","title":"Ego4d: Around the world in 3,000 hours of egocentric video","venue":null,"work_id":"7bb38f4d-e6f2-4ffd-a23a-9932e1f1ee82","year":2022},"citing_paper":{"arxiv_id":"2506.00827","last_updated":"2025-06-01T04:22:02Z","snapshot_observed_at":"2026-08-10T08:13:07.260920Z","submitted_at":"2025-06-01T04:22:02Z","title":"Improving Keystep Recognition in Ego-Video via Dexterous Focus","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T11:59:04.117291Z"},"links":{"citing_paper":"/paper/2506.00827"},"observation_digest":"sha256:53ed32053f5dae86beca720434480483915699426d10fbe936170bbe444545f7","observation_id":"66932c3b-2b11-4283-aeec-d96c5049da21","resolution":{"observed_at":"2026-08-07T11:59:08.993075Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:59:08.644402Z","title":"Ego-exo4d: Understanding skilled human activity from first- and third-person perspectives","venue":null,"work_id":"79659e6f-d7b9-43f1-8ef0-4d71b43bf666","year":2024},"citing_paper":{"arxiv_id":"2506.00827","last_updated":"2025-06-01T04:22:02Z","snapshot_observed_at":"2026-08-10T08:13:07.260920Z","submitted_at":"2025-06-01T04:22:02Z","title":"Improving Keystep Recognition in Ego-Video via Dexterous Focus","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T11:59:04.282107Z"},"links":{"citing_paper":"/paper/2506.00827"},"observation_digest":"sha256:80b26cf595a180ad141d713a7557702d64b2673eee6092c2bc7951137826079a","observation_id":"4c95153d-6583-4f16-9ede-e22832de8963","resolution":{"observed_at":"2026-08-07T11:59:08.753227Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:59:08.409637Z","title":"Jiang, J","venue":null,"work_id":"d3380bcf-a24e-474a-a27b-6aff97fb244c","year":2014},"citing_paper":{"arxiv_id":"2506.00827","last_updated":"2025-06-01T04:22:02Z","snapshot_observed_at":"2026-08-10T08:13:07.260920Z","submitted_at":"2025-06-01T04:22:02Z","title":"Improving Keystep Recognition in Ego-Video via Dexterous Focus","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T11:59:04.419006Z"},"links":{"citing_paper":"/paper/2506.00827"},"observation_digest":"sha256:a86a1fa1220c46a3de236a05c4281c610a64a39585e5e1c9630265651ed42954","observation_id":"1efd576f-2e94-47ee-95b1-7a71c17383e7","resolution":{"observed_at":"2026-08-07T11:59:08.535971Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1705.06950","last_updated":"2017-05-19T12:07:01Z","snapshot_observed_at":"2026-08-08T17:46:50.107463Z","submitted_at":"2017-05-19T12:07:01Z","title":"The Kinetics Human Action Video Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.06950","snapshot_observed_at":"2026-08-07T11:59:04.567274Z","title":"The kinetics hu- man action video dataset","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.00827","last_updated":"2025-06-01T04:22:02Z","snapshot_observed_at":"2026-08-10T08:13:07.260920Z","submitted_at":"2025-06-01T04:22:02Z","title":"Improving Keystep Recognition in Ego-Video via Dexterous Focus","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T11:59:04.567274Z"},"links":{"cited_paper":"/paper/1705.06950","citing_paper":"/paper/2506.00827"},"observation_digest":"sha256:fc378e79863f0b2d0b89148704860e01a11a573db7918c82e8383ab0ada039c3","observation_id":"48a33909-d9a7-4168-a6ad-a43e964f66c7","resolution":{"observed_at":"2026-08-07T11:59:04.567274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:59:08.208062Z","title":"Epic-fusion: Audio-visual temporal binding for egocentric action recognition","venue":null,"work_id":"745a9a55-006e-456d-bdec-835df53f68b6","year":2019},"citing_paper":{"arxiv_id":"2506.00827","last_updated":"2025-06-01T04:22:02Z","snapshot_observed_at":"2026-08-10T08:13:07.260920Z","submitted_at":"2025-06-01T04:22:02Z","title":"Improving Keystep Recognition in Ego-Video via Dexterous Focus","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T11:59:04.723588Z"},"links":{"citing_paper":"/paper/2506.00827"},"observation_digest":"sha256:6517040263c64c3b25d0aa7be26bf7e69f9c728dfdf081838759866072b133e5","observation_id":"8451dedf-ce70-46ab-a700-ecaed6225350","resolution":{"observed_at":"2026-08-07T11:59:08.297259Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:59:04.874486Z","title":"Human action recognition and predic- tion: A survey","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.00827","last_updated":"2025-06-01T04:22:02Z","snapshot_observed_at":"2026-08-10T08:13:07.260920Z","submitted_at":"2025-06-01T04:22:02Z","title":"Improving Keystep Recognition in Ego-Video via Dexterous Focus","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T11:59:04.874486Z"},"links":{"citing_paper":"/paper/2506.00827"},"observation_digest":"sha256:2f5b3996e40db329ccbab4e23695f0a8a60b7db4d7277ae2a94c00719526d7bd","observation_id":"40a7b2ac-a119-4eff-8dc0-629831ba756b","resolution":{"observed_at":"2026-08-07T11:59:04.874486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:59:07.964430Z","title":"X-mic: Cross-modal instance conditioning for egocentric action gen- eralization","venue":null,"work_id":"67050b05-e31b-45e1-8b73-0513bdbbba00","year":2024},"citing_paper":{"arxiv_id":"2506.00827","last_updated":"2025-06-01T04:22:02Z","snapshot_observed_at":"2026-08-10T08:13:07.260920Z","submitted_at":"2025-06-01T04:22:02Z","title":"Improving Keystep Recognition in Ego-Video via Dexterous Focus","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T11:59:04.959598Z"},"links":{"citing_paper":"/paper/2506.00827"},"observation_digest":"sha256:ff2272620f99ad55037f0f46087a93c94d159bd23713f322aea212311e793b05","observation_id":"b0aeda98-7a95-4851-9142-0e617663e98c","resolution":{"observed_at":"2026-08-07T11:59:08.080916Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:59:07.750969Z","title":"Ego-exo: Transferring visual representations from third-person to first-person videos","venue":null,"work_id":"779ec45a-97b7-40bc-88a6-d28162aff5c9","year":2021},"citing_paper":{"arxiv_id":"2506.00827","last_updated":"2025-06-01T04:22:02Z","snapshot_observed_at":"2026-08-10T08:13:07.260920Z","submitted_at":"2025-06-01T04:22:02Z","title":"Improving Keystep Recognition in Ego-Video via Dexterous Focus","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T11:59:05.102608Z"},"links":{"citing_paper":"/paper/2506.00827"},"observation_digest":"sha256:2699374a192c7cd2e63f5878c00c512e1b56c18ba82c0c15f33737b274007e40","observation_id":"fadc45a9-2ed8-401f-ba91-ae8cc6ed7a39","resolution":{"observed_at":"2026-08-07T11:59:07.845496Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.01670","last_updated":"2022-10-13T03:31:05Z","snapshot_observed_at":"2026-08-02T02:01:02.764427Z","submitted_at":"2022-06-03T16:28:58Z","title":"Egocentric Video-Language Pretraining","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.01670","snapshot_observed_at":"2026-08-07T11:59:05.218954Z","title":"Egocentric video-language pretraining","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.00827","last_updated":"2025-06-01T04:22:02Z","snapshot_observed_at":"2026-08-10T08:13:07.260920Z","submitted_at":"2025-06-01T04:22:02Z","title":"Improving Keystep Recognition in Ego-Video via Dexterous Focus","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T11:59:05.218954Z"},"links":{"cited_paper":"/paper/2206.01670","citing_paper":"/paper/2506.00827"},"observation_digest":"sha256:7e5bff104d42ac6c5e34f0180d1e5c1bf0f59527700a96003f94b0194c58b0cb","observation_id":"346dd980-3330-42c3-9f7d-44302af0302c","resolution":{"observed_at":"2026-08-07T11:59:05.218954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:59:07.543864Z","title":"Where a strong backbone meets strong features – action- former for ego4d moment queries challenge","venue":null,"work_id":"f3e9ec11-1ca9-45f4-be7e-10036a25855c","year":null},"citing_paper":{"arxiv_id":"2506.00827","last_updated":"2025-06-01T04:22:02Z","snapshot_observed_at":"2026-08-10T08:13:07.260920Z","submitted_at":"2025-06-01T04:22:02Z","title":"Improving Keystep Recognition in Ego-Video via Dexterous Focus","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T11:59:05.321906Z"},"links":{"citing_paper":"/paper/2506.00827"},"observation_digest":"sha256:0f71aed36f53eb3ac45dc58f3018a63c94b54d23eeb9ac0c9b08cfdc0ea599b1","observation_id":"d544b563-dcdd-462c-892d-56b189b820b2","resolution":{"observed_at":"2026-08-07T11:59:07.646633Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:59:07.310914Z","title":"Egoenv: Human- centric environment representations from egocentric video","venue":null,"work_id":"ed4c759e-2c66-47a7-b3c3-4642f972e28b","year":2023},"citing_paper":{"arxiv_id":"2506.00827","last_updated":"2025-06-01T04:22:02Z","snapshot_observed_at":"2026-08-10T08:13:07.260920Z","submitted_at":"2025-06-01T04:22:02Z","title":"Improving Keystep Recognition in Ego-Video via Dexterous Focus","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T11:59:05.427141Z"},"links":{"citing_paper":"/paper/2506.00827"},"observation_digest":"sha256:07a121522deeabb1bc5684c92568a6556e80b5c377b34fdb842eaf895a392106","observation_id":"3d699295-a9ef-48c6-a957-15ee3edeb865","resolution":{"observed_at":"2026-08-07T11:59:07.399174Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:59:07.057757Z","title":"Project aria: A new tool for ego- centric multi-modal ai research, 2023","venue":null,"work_id":"ee701ba4-b9e0-43d7-bdda-7d1767a21fa6","year":2023},"citing_paper":{"arxiv_id":"2506.00827","last_updated":"2025-06-01T04:22:02Z","snapshot_observed_at":"2026-08-10T08:13:07.260920Z","submitted_at":"2025-06-01T04:22:02Z","title":"Improving Keystep Recognition in Ego-Video via Dexterous Focus","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T11:59:05.530517Z"},"links":{"citing_paper":"/paper/2506.00827"},"observation_digest":"sha256:9879a9da7b6704970b7e7b5766989ad63a14ccf7b32f5aafe0da5bfa501dce47","observation_id":"b028e65e-5af7-44d2-847d-cc2e36b35e00","resolution":{"observed_at":"2026-08-07T11:59:07.179449Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18070","last_updated":"2024-07-01T02:44:11Z","snapshot_observed_at":"2026-08-03T16:08:46.390961Z","submitted_at":"2024-06-26T05:01:37Z","title":"EgoVideo: Exploring Egocentric Foundation Model and Downstream Adaptation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18070","snapshot_observed_at":"2026-08-07T11:59:05.646267Z","title":"Egovideo: Exploring egocentric foun- dation model and downstream adaptation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00827","last_updated":"2025-06-01T04:22:02Z","snapshot_observed_at":"2026-08-10T08:13:07.260920Z","submitted_at":"2025-06-01T04:22:02Z","title":"Improving Keystep Recognition in Ego-Video via Dexterous Focus","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T11:59:05.646267Z"},"links":{"cited_paper":"/paper/2406.18070","citing_paper":"/paper/2506.00827"},"observation_digest":"sha256:11df49d4ab8c44e744ec3503058e1ffa1025ecc971333e81c572ef9b5501d56f","observation_id":"947f55c1-1528-4471-91e6-07c289a7e6b9","resolution":{"observed_at":"2026-08-07T11:59:05.646267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.05463","last_updated":"2023-08-19T03:38:55Z","snapshot_observed_at":"2026-07-06T15:52:44.676636Z","submitted_at":"2023-07-11T17:50:15Z","title":"EgoVLPv2: Egocentric Video-Language Pre-training with Fusion in the Backbone","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.05463","snapshot_observed_at":"2026-08-07T11:59:05.781867Z","title":"Egovlpv2: Egocentric video- language pre-training with fusion in the backbone","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00827","last_updated":"2025-06-01T04:22:02Z","snapshot_observed_at":"2026-08-10T08:13:07.260920Z","submitted_at":"2025-06-01T04:22:02Z","title":"Improving Keystep Recognition in Ego-Video via Dexterous Focus","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T11:59:05.781867Z"},"links":{"cited_paper":"/paper/2307.05463","citing_paper":"/paper/2506.00827"},"observation_digest":"sha256:47cc1588d99a1197c6599cb284460366ca4560c8c8438e244a1955bb41a3f0d7","observation_id":"fb824526-af44-4294-9793-660ddbe35d51","resolution":{"observed_at":"2026-08-07T11:59:05.781867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:59:06.766815Z","title":"Understanding human hands in contact at internet scale","venue":null,"work_id":"28da70e9-f705-4375-be9b-1e6eef66557f","year":2020},"citing_paper":{"arxiv_id":"2506.00827","last_updated":"2025-06-01T04:22:02Z","snapshot_observed_at":"2026-08-10T08:13:07.260920Z","submitted_at":"2025-06-01T04:22:02Z","title":"Improving Keystep Recognition in Ego-Video via Dexterous Focus","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T11:59:05.899839Z"},"links":{"citing_paper":"/paper/2506.00827"},"observation_digest":"sha256:bd4a1222a4b3a1d499b9844707948784e8172134f9ac8a5915fbfc2809d5fc24","observation_id":"79cdaa7a-0386-48ac-9509-6de7f4c6d0d8","resolution":{"observed_at":"2026-08-07T11:59:06.899474Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-07-06T06:49:24.960992Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-08-07T11:59:06.003000Z","title":"Repre- sentation learning with contrastive predictive coding","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.00827","last_updated":"2025-06-01T04:22:02Z","snapshot_observed_at":"2026-08-10T08:13:07.260920Z","submitted_at":"2025-06-01T04:22:02Z","title":"Improving Keystep Recognition in Ego-Video via Dexterous Focus","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T11:59:06.003000Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2506.00827"},"observation_digest":"sha256:a6955800b70b45500eb46a308f7308f08e744ac0a34ba06fff77e424d49e5a51","observation_id":"e00bff9a-e979-4536-b5e7-5081ae2ed929","resolution":{"observed_at":"2026-08-07T11:59:06.003000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-07T11:59:06.099409Z","title":"Internvideo: General video foundation models via generative and discriminative learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.00827","last_updated":"2025-06-01T04:22:02Z","snapshot_observed_at":"2026-08-10T08:13:07.260920Z","submitted_at":"2025-06-01T04:22:02Z","title":"Improving Keystep Recognition in Ego-Video via Dexterous Focus","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T11:59:06.099409Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2506.00827"},"observation_digest":"sha256:45ea00454ca89ed762974a54ab44e1017cde8d98283dfdf9f98ad5fff671c52c","observation_id":"348e432f-cd03-416b-8af0-23bf91de4165","resolution":{"observed_at":"2026-08-07T11:59:06.099409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.09852","last_updated":"2022-06-20T15:31:13Z","snapshot_observed_at":"2026-08-07T22:31:22.587774Z","submitted_at":"2022-06-20T15:31:13Z","title":"M&M Mix: A Multimodal Multiview Transformer Ensemble","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.09852","snapshot_observed_at":"2026-08-07T11:59:06.205021Z","title":"M&m mix: A multimodal multiview transformer ensemble","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.00827","last_updated":"2025-06-01T04:22:02Z","snapshot_observed_at":"2026-08-10T08:13:07.260920Z","submitted_at":"2025-06-01T04:22:02Z","title":"Improving Keystep Recognition in Ego-Video via Dexterous Focus","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T11:59:06.205021Z"},"links":{"cited_paper":"/paper/2206.09852","citing_paper":"/paper/2506.00827"},"observation_digest":"sha256:5cc02d8d0c68eb075b5935a0db9ad692bed7709b558b8b1fbd8071f7b19cf9d1","observation_id":"adfd9535-5c8b-4070-a0fc-537de4b1c8a5","resolution":{"observed_at":"2026-08-07T11:59:06.205021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:59:06.573154Z","title":"Actionformer: Lo- calizing moments of actions with transformers","venue":null,"work_id":"201e57b7-0ba1-4bec-b76a-f991ab76c8d5","year":2022},"citing_paper":{"arxiv_id":"2506.00827","last_updated":"2025-06-01T04:22:02Z","snapshot_observed_at":"2026-08-10T08:13:07.260920Z","submitted_at":"2025-06-01T04:22:02Z","title":"Improving Keystep Recognition in Ego-Video via Dexterous Focus","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T11:59:06.328656Z"},"links":{"citing_paper":"/paper/2506.00827"},"observation_digest":"sha256:c4b91cca9c4e063ce1574d79a1d6d9e30301075ea235a16c9ebae96680eb0a81","observation_id":"25ad6a03-c343-4276-a302-0a57316e7302","resolution":{"observed_at":"2026-08-07T11:59:06.664550Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.00827","last_updated":"2025-06-01T04:22:02Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-10T08:13:07.260920Z","submitted_at":"2025-06-01T04:22:02Z","title":"Improving Keystep Recognition in Ego-Video via Dexterous Focus"},"reference_resolution":{"displayed":25,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":9,"verified_exact":0,"verified_fuzzy":16},"total_outbound_references":25},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 25 of 25 outbound references and 0 inbound Pith citation observations for arXiv:2506.00827."}