{"as_of":"2026-08-10T19:38:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:715f55256a870695e5b5afb815045b4c57909b3e40a0d47627cecda8de64267b","coverage":[{"denominator":52,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":52,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T13:44:12.467300Z","state":"measured"},{"denominator":52,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":52,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2509.00385/citation-record","integrity":"/paper/2509.00385/integrity","json":"/paper/2509.00385/citation-record.json","paper":"/paper/2509.00385"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:44:21.449131Z","title":"The reverse hierarchy theory of visual perceptual learning","venue":null,"work_id":"288d50f6-7a58-4b48-9b9f-c647aa97c1b9","year":2004},"citing_paper":{"arxiv_id":"2509.00385","last_updated":"2025-08-30T06:50:49Z","snapshot_observed_at":"2026-08-10T11:34:20.945815Z","submitted_at":"2025-08-30T06:50:49Z","title":"HERO-VQL: Hierarchical, Egocentric and Robust Visual Query Localization","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:06.734568Z"},"links":{"citing_paper":"/paper/2509.00385"},"observation_digest":"sha256:7fdf339d056cdc3bee5c05569d1645ba9f2ca5d851827f48025caad2545c0941","observation_id":"343da560-cc26-48ff-b134-c373326dcdf1","resolution":{"observed_at":"2026-08-05T13:44:21.594179Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:44:21.307394Z","title":"Unsupervised learning of visual features by contrasting cluster assign- ments","venue":null,"work_id":"0bb39637-44a3-47f7-9a42-32d497fd03bc","year":2020},"citing_paper":{"arxiv_id":"2509.00385","last_updated":"2025-08-30T06:50:49Z","snapshot_observed_at":"2026-08-10T11:34:20.945815Z","submitted_at":"2025-08-30T06:50:49Z","title":"HERO-VQL: Hierarchical, Egocentric and Robust Visual Query Localization","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:06.792454Z"},"links":{"citing_paper":"/paper/2509.00385"},"observation_digest":"sha256:4d663ca0f292e7a97562c037ca6ebba3d618bb83d3eae14264ac56a4c69e30f9","observation_id":"624581e3-a65d-494d-95e5-06b19ff90b7e","resolution":{"observed_at":"2026-08-05T13:44:21.364489Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:44:06.889279Z","title":"Generative pretraining from pixels","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.00385","last_updated":"2025-08-30T06:50:49Z","snapshot_observed_at":"2026-08-10T11:34:20.945815Z","submitted_at":"2025-08-30T06:50:49Z","title":"HERO-VQL: Hierarchical, Egocentric and Robust Visual Query Localization","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:06.889279Z"},"links":{"citing_paper":"/paper/2509.00385"},"observation_digest":"sha256:5e729a2509da464925de5dfc26e700fbbb3676fa9baf9c257f97f8630d3f4438","observation_id":"30b9d34e-4101-43e7-81dd-afa08cfb0788","resolution":{"observed_at":"2026-08-05T13:44:06.889279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:44:06.936956Z","title":"A simple framework for contrastive learning of visual representations","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.00385","last_updated":"2025-08-30T06:50:49Z","snapshot_observed_at":"2026-08-10T11:34:20.945815Z","submitted_at":"2025-08-30T06:50:49Z","title":"HERO-VQL: Hierarchical, Egocentric and Robust Visual Query Localization","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:06.936956Z"},"links":{"citing_paper":"/paper/2509.00385"},"observation_digest":"sha256:0f136a24ddda8b79b43f3e39047df183fe9bd0aa34e6a8aca95f8f74f1b00b1f","observation_id":"efb65a25-6af5-4bca-b995-7eb6f9556b66","resolution":{"observed_at":"2026-08-05T13:44:06.936956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:44:07.015401Z","title":"Detect what you can: Detecting and representing objects using holistic models and body parts","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2509.00385","last_updated":"2025-08-30T06:50:49Z","snapshot_observed_at":"2026-08-10T11:34:20.945815Z","submitted_at":"2025-08-30T06:50:49Z","title":"HERO-VQL: Hierarchical, Egocentric and Robust Visual Query Localization","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:07.015401Z"},"links":{"citing_paper":"/paper/2509.00385"},"observation_digest":"sha256:733c10695db462b6c6cceb94109ad3490f9757257b3b0f35c63772cd9b6d87dd","observation_id":"0b1a6c6c-a244-49f0-8bbe-b440157a6347","resolution":{"observed_at":"2026-08-05T13:44:07.015401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:44:21.112504Z","title":"Seq- track: Unified sequence-to-sequence learning for single- and multi-modal visual object tracking","venue":null,"work_id":"9420fa70-6a55-45de-9a1e-2b6e9798fb3a","year":2023},"citing_paper":{"arxiv_id":"2509.00385","last_updated":"2025-08-30T06:50:49Z","snapshot_observed_at":"2026-08-10T11:34:20.945815Z","submitted_at":"2025-08-30T06:50:49Z","title":"HERO-VQL: Hierarchical, Egocentric and Robust Visual Query Localization","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:07.089046Z"},"links":{"citing_paper":"/paper/2509.00385"},"observation_digest":"sha256:5c0894601f2f5a60ebff7f77a5711404b3cb96cfe6148096e4094a47303b460f","observation_id":"5d28a930-f42c-416a-a09a-3b2eb87aa996","resolution":{"observed_at":"2026-08-05T13:44:21.214840Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:44:20.924229Z","title":"Category-aware allocation transformer for weakly supervised object localization","venue":null,"work_id":"81ff0909-579c-46d2-a89a-9212ddb07d44","year":2023},"citing_paper":{"arxiv_id":"2509.00385","last_updated":"2025-08-30T06:50:49Z","snapshot_observed_at":"2026-08-10T11:34:20.945815Z","submitted_at":"2025-08-30T06:50:49Z","title":"HERO-VQL: Hierarchical, Egocentric and Robust Visual Query Localization","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:07.237436Z"},"links":{"citing_paper":"/paper/2509.00385"},"observation_digest":"sha256:9200dc89ada83031315be21ff03b2a6a20f0dfd5e74cc2e781184675a0114caa","observation_id":"81a5e480-f3a5-40cf-bca3-b094530c63af","resolution":{"observed_at":"2026-08-05T13:44:20.969466Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:44:20.784628Z","title":"Unsupervised object dis- covery and localization in the wild: Part-based matching with bottom-up region pro- posals","venue":null,"work_id":"ce8fee27-d3dd-4719-bd98-e3a9401f6b48","year":2015},"citing_paper":{"arxiv_id":"2509.00385","last_updated":"2025-08-30T06:50:49Z","snapshot_observed_at":"2026-08-10T11:34:20.945815Z","submitted_at":"2025-08-30T06:50:49Z","title":"HERO-VQL: Hierarchical, Egocentric and Robust Visual Query Localization","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:07.393746Z"},"links":{"citing_paper":"/paper/2509.00385"},"observation_digest":"sha256:5096c97d7094655da6bf19dbc57e78e8d02b30cef7c3daf306bbb47737bbd1c5","observation_id":"951dcd1f-9f65-4e4e-a048-d11e8c425476","resolution":{"observed_at":"2026-08-05T13:44:20.844592Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:44:20.636520Z","title":"Mixformer: End-to-end tracking with iterative mixed attention","venue":null,"work_id":"72d9dbdd-33de-4fc5-abec-61b52f7178c7","year":2022},"citing_paper":{"arxiv_id":"2509.00385","last_updated":"2025-08-30T06:50:49Z","snapshot_observed_at":"2026-08-10T11:34:20.945815Z","submitted_at":"2025-08-30T06:50:49Z","title":"HERO-VQL: Hierarchical, Egocentric and Robust Visual Query Localization","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:07.538345Z"},"links":{"citing_paper":"/paper/2509.00385"},"observation_digest":"sha256:58a9b9941278a28627095c91c8289dd8d4ccd790d722cb9758ee1b5245f3e775","observation_id":"36dff553-d615-4d5e-90a7-f2a4f94c41dd","resolution":{"observed_at":"2026-08-05T13:44:20.694813Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:44:20.455969Z","title":"Scaling egocentric vision: The epic-kitchens dataset","venue":null,"work_id":"386cff51-d04f-4780-9ac1-42124a1e2896","year":2018},"citing_paper":{"arxiv_id":"2509.00385","last_updated":"2025-08-30T06:50:49Z","snapshot_observed_at":"2026-08-10T11:34:20.945815Z","submitted_at":"2025-08-30T06:50:49Z","title":"HERO-VQL: Hierarchical, Egocentric and Robust Visual Query Localization","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:07.668157Z"},"links":{"citing_paper":"/paper/2509.00385"},"observation_digest":"sha256:289b615e2e0779861b67dd5f8774a8a7bc78b9907df5015256b30d36dc2b3c6c","observation_id":"71982cae-6936-426c-8b99-49802d5674ea","resolution":{"observed_at":"2026-08-05T13:44:20.551822Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:44:20.260064Z","title":"Augmented reality smart glasses in industrial assembly: Current status and future challenges","venue":null,"work_id":"ea167c10-0c12-47c0-8257-9bcf43c5fc75","year":2020},"citing_paper":{"arxiv_id":"2509.00385","last_updated":"2025-08-30T06:50:49Z","snapshot_observed_at":"2026-08-10T11:34:20.945815Z","submitted_at":"2025-08-30T06:50:49Z","title":"HERO-VQL: Hierarchical, Egocentric and Robust Visual Query Localization","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:07.800976Z"},"links":{"citing_paper":"/paper/2509.00385"},"observation_digest":"sha256:f37c3b840b42fbc00a1d942f17597d2a2bf06643c231f133a0c7a9716d375f25","observation_id":"e2d28dda-257b-4ef4-8e91-1fed8f372f12","resolution":{"observed_at":"2026-08-05T13:44:20.347230Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:44:20.098356Z","title":"Is first person vision challenging for object tracking? In ICCVW, 2021","venue":null,"work_id":"b7213bed-fd70-40da-a8ac-cb0999a7e3d2","year":2021},"citing_paper":{"arxiv_id":"2509.00385","last_updated":"2025-08-30T06:50:49Z","snapshot_observed_at":"2026-08-10T11:34:20.945815Z","submitted_at":"2025-08-30T06:50:49Z","title":"HERO-VQL: Hierarchical, Egocentric and Robust Visual Query Localization","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:07.911097Z"},"links":{"citing_paper":"/paper/2509.00385"},"observation_digest":"sha256:14732df7556e1434f020be59a45b1b1da79d8d603e34547e98c7b9a46de27a78","observation_id":"9dba88ef-93a7-4950-b8c3-4dcfea20158e","resolution":{"observed_at":"2026-08-05T13:44:20.177501Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:44:19.914754Z","title":"Pairwise body-part attention for recognizing human-object interactions","venue":null,"work_id":"57386756-f7c8-4fd3-ad67-cb14b4f0dc8d","year":2018},"citing_paper":{"arxiv_id":"2509.00385","last_updated":"2025-08-30T06:50:49Z","snapshot_observed_at":"2026-08-10T11:34:20.945815Z","submitted_at":"2025-08-30T06:50:49Z","title":"HERO-VQL: Hierarchical, Egocentric and Robust Visual Query Localization","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:07.974127Z"},"links":{"citing_paper":"/paper/2509.00385"},"observation_digest":"sha256:48ad344e690641c542cfd8311620c787b52c5905cad8cb8bdaf0c60217bc40ff","observation_id":"19a2433d-cb1f-42a6-92ff-3b2a2a0d71c7","resolution":{"observed_at":"2026-08-05T13:44:19.988181Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:44:19.739375Z","title":"Amego: Ac- tive memory from long egocentric videos","venue":null,"work_id":"7b1fbf5f-499c-4b7f-8d53-fa19ed25568d","year":2024},"citing_paper":{"arxiv_id":"2509.00385","last_updated":"2025-08-30T06:50:49Z","snapshot_observed_at":"2026-08-10T11:34:20.945815Z","submitted_at":"2025-08-30T06:50:49Z","title":"HERO-VQL: Hierarchical, Egocentric and Robust Visual Query Localization","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:08.099016Z"},"links":{"citing_paper":"/paper/2509.00385"},"observation_digest":"sha256:7e057550595f53c54e1d2e7210b1f14a9256bfdd0f9184dcf8dfdfcd5b6b9a51","observation_id":"40c63a19-4fa9-4d93-a53b-4095f4758950","resolution":{"observed_at":"2026-08-05T13:44:19.846902Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:44:19.616632Z","title":"Robotic home assistant care-o-bot® 3 - product vision and innovation platform","venue":null,"work_id":"cdb86024-26e5-4183-8899-681aa5a4c191","year":2009},"citing_paper":{"arxiv_id":"2509.00385","last_updated":"2025-08-30T06:50:49Z","snapshot_observed_at":"2026-08-10T11:34:20.945815Z","submitted_at":"2025-08-30T06:50:49Z","title":"HERO-VQL: Hierarchical, Egocentric and Robust Visual Query Localization","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:08.196820Z"},"links":{"citing_paper":"/paper/2509.00385"},"observation_digest":"sha256:b436d03aabd3649026c5163f37bf945b46ce91faed41ba4f5bd1525dca4a4721","observation_id":"ee8e6332-f54c-4e09-8db3-c441e8d0eedd","resolution":{"observed_at":"2026-08-05T13:44:19.659164Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:44:08.284879Z","title":"Ego4d: Around the world in 3,000 hours of egocentric video","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.00385","last_updated":"2025-08-30T06:50:49Z","snapshot_observed_at":"2026-08-10T11:34:20.945815Z","submitted_at":"2025-08-30T06:50:49Z","title":"HERO-VQL: Hierarchical, Egocentric and Robust Visual Query Localization","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:08.284879Z"},"links":{"citing_paper":"/paper/2509.00385"},"observation_digest":"sha256:0e431c9ba85e442a332593ba1d10e855cc5981192f43eeac1fbfd4e99035ad7d","observation_id":"d7ce5496-0a70-49b4-840d-0ef1396f4106","resolution":{"observed_at":"2026-08-05T13:44:08.284879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:44:19.487821Z","title":null,"venue":null,"work_id":"dd42f962-d318-4dc6-b4df-4ea4a559e95c","year":2024},"citing_paper":{"arxiv_id":"2509.00385","last_updated":"2025-08-30T06:50:49Z","snapshot_observed_at":"2026-08-10T11:34:20.945815Z","submitted_at":"2025-08-30T06:50:49Z","title":"HERO-VQL: Hierarchical, Egocentric and Robust Visual Query Localization","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:08.426028Z"},"links":{"citing_paper":"/paper/2509.00385"},"observation_digest":"sha256:3280efb4142cb0a482d7a18eedac15f2e202032baf2683464785e86f8c3354b1","observation_id":"56d297b6-a05b-42f6-b426-dff0de459dc2","resolution":{"observed_at":"2026-08-05T13:44:19.543480Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:44:19.328822Z","title":"Bootstrap your own latent-a new approach to self- supervised learning","venue":null,"work_id":"df128da5-ca05-4d13-9b03-0a6e5ea0343b","year":2020},"citing_paper":{"arxiv_id":"2509.00385","last_updated":"2025-08-30T06:50:49Z","snapshot_observed_at":"2026-08-10T11:34:20.945815Z","submitted_at":"2025-08-30T06:50:49Z","title":"HERO-VQL: Hierarchical, Egocentric and Robust Visual Query Localization","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:08.576387Z"},"links":{"citing_paper":"/paper/2509.00385"},"observation_digest":"sha256:0b92f41073ea93f6f666f1fb3e0a4ade5575a3ca0d4e26ac34d608d7768a9b21","observation_id":"437d4cd3-1171-4ee1-97f7-4f70ec66a548","resolution":{"observed_at":"2026-08-05T13:44:19.402423Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:44:19.183637Z","title":"Momentum con- trast for unsupervised visual representation learning","venue":null,"work_id":"b05f091c-f88f-407e-954d-6b6ddbf84f42","year":2020},"citing_paper":{"arxiv_id":"2509.00385","last_updated":"2025-08-30T06:50:49Z","snapshot_observed_at":"2026-08-10T11:34:20.945815Z","submitted_at":"2025-08-30T06:50:49Z","title":"HERO-VQL: Hierarchical, Egocentric and Robust Visual Query Localization","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:08.673786Z"},"links":{"citing_paper":"/paper/2509.00385"},"observation_digest":"sha256:163dffdd180eacff08acf2293fc22d8fe736249cc973234c8f306c0c38d8ffa0","observation_id":"2bc5a3a4-96bc-4e39-a232-a4989467bad7","resolution":{"observed_at":"2026-08-05T13:44:19.247637Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:44:19.035333Z","title":"View from the top: Hierarchies and reverse hier- archies in the visual system","venue":null,"work_id":"efef95d9-76c4-41ac-960a-33155909ce31","year":2002},"citing_paper":{"arxiv_id":"2509.00385","last_updated":"2025-08-30T06:50:49Z","snapshot_observed_at":"2026-08-10T11:34:20.945815Z","submitted_at":"2025-08-30T06:50:49Z","title":"HERO-VQL: Hierarchical, Egocentric and Robust Visual Query Localization","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:08.769670Z"},"links":{"citing_paper":"/paper/2509.00385"},"observation_digest":"sha256:303f4e9d40674017ed5d66cec74acd772deb82d102f7c6cebf45dd1a250bb782","observation_id":"b9daf06e-6b97-41d8-8b5c-75fa0d92b639","resolution":{"observed_at":"2026-08-05T13:44:19.124177Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:44:18.881596Z","title":"Egocentric audio-visual object localization","venue":null,"work_id":"ee90c123-cd33-499e-bff4-dd7e5e70231e","year":2023},"citing_paper":{"arxiv_id":"2509.00385","last_updated":"2025-08-30T06:50:49Z","snapshot_observed_at":"2026-08-10T11:34:20.945815Z","submitted_at":"2025-08-30T06:50:49Z","title":"HERO-VQL: Hierarchical, Egocentric and Robust Visual Query Localization","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:08.863920Z"},"links":{"citing_paper":"/paper/2509.00385"},"observation_digest":"sha256:6d6e751641c76e7611390b558d0e9868ca66813268edd85aa52a3d7dc41d902e","observation_id":"851b8dfb-79ae-4486-a853-0d8b809253c3","resolution":{"observed_at":"2026-08-05T13:44:18.964756Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:44:18.730464Z","title":"Video recap: Recursive captioning of hour-long videos","venue":null,"work_id":"fb55a016-8360-4d35-9bbe-4f66f23a9779","year":2024},"citing_paper":{"arxiv_id":"2509.00385","last_updated":"2025-08-30T06:50:49Z","snapshot_observed_at":"2026-08-10T11:34:20.945815Z","submitted_at":"2025-08-30T06:50:49Z","title":"HERO-VQL: Hierarchical, Egocentric and Robust Visual Query Localization","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:08.970275Z"},"links":{"citing_paper":"/paper/2509.00385"},"observation_digest":"sha256:41ef9420be983a2c2f788e4f0dc360a02b0001ec19a6b02d90d0ccac82afef4f","observation_id":"297bef9c-b1f1-45c6-ac0a-02b38b0ac74f","resolution":{"observed_at":"2026-08-05T13:44:18.795345Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:44:18.605182Z","title":"Detrs with hybrid matching","venue":null,"work_id":"50b96e54-1803-4fa8-8dee-cef04bc44c76","year":2023},"citing_paper":{"arxiv_id":"2509.00385","last_updated":"2025-08-30T06:50:49Z","snapshot_observed_at":"2026-08-10T11:34:20.945815Z","submitted_at":"2025-08-30T06:50:49Z","title":"HERO-VQL: Hierarchical, Egocentric and Robust Visual Query Localization","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:09.111805Z"},"links":{"citing_paper":"/paper/2509.00385"},"observation_digest":"sha256:3574ac939b953c2fb4254fed884acfdaf5fb0e3c97fb1bc21385449e766caecb","observation_id":"38a075b8-734c-411b-be49-362547e70648","resolution":{"observed_at":"2026-08-05T13:44:18.659210Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:44:18.508261Z","title":"Single-stage visual query localization in egocentric videos","venue":null,"work_id":"e2a6a357-9147-4dc8-9c2a-8a0e8a8f5c42","year":2023},"citing_paper":{"arxiv_id":"2509.00385","last_updated":"2025-08-30T06:50:49Z","snapshot_observed_at":"2026-08-10T11:34:20.945815Z","submitted_at":"2025-08-30T06:50:49Z","title":"HERO-VQL: Hierarchical, Egocentric and Robust Visual Query Localization","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:09.256521Z"},"links":{"citing_paper":"/paper/2509.00385"},"observation_digest":"sha256:011561f0b7e33baf4a9cede6bea549197493227f1e435fab92923a9d66cfa7ca","observation_id":"4b48aa6c-ba8a-42ca-8b8a-081a402c000b","resolution":{"observed_at":"2026-08-05T13:44:18.548988Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:44:09.367167Z","title":"Sam2mot: A novel paradigm of multi-object tracking by segmentation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.00385","last_updated":"2025-08-30T06:50:49Z","snapshot_observed_at":"2026-08-10T11:34:20.945815Z","submitted_at":"2025-08-30T06:50:49Z","title":"HERO-VQL: Hierarchical, Egocentric and Robust Visual Query Localization","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:09.367167Z"},"links":{"citing_paper":"/paper/2509.00385"},"observation_digest":"sha256:002cd2a37bb4289daa4f859cc1b4c6be88910033708a9d9d26e752c376672a8e","observation_id":"1399fc09-ceb5-4072-b1bf-17a5bdd684df","resolution":{"observed_at":"2026-08-05T13:44:09.367167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:44:18.377008Z","title":"Refego: Referring expression compre- hension dataset from first-person perception of ego4d","venue":null,"work_id":"de97be51-60a8-4ba2-b3ac-d6a03595d212","year":2023},"citing_paper":{"arxiv_id":"2509.00385","last_updated":"2025-08-30T06:50:49Z","snapshot_observed_at":"2026-08-10T11:34:20.945815Z","submitted_at":"2025-08-30T06:50:49Z","title":"HERO-VQL: Hierarchical, Egocentric and Robust Visual Query Localization","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:09.463880Z"},"links":{"citing_paper":"/paper/2509.00385"},"observation_digest":"sha256:49cfbdd641dc66a8635146c22c4a2de9f3c4f3436c6ec446ff8c033df452e811","observation_id":"1769a7c3-a6ff-4e3f-81e8-020793cfea0e","resolution":{"observed_at":"2026-08-05T13:44:18.452493Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:44:18.234822Z","title":"Locate: Localize and transfer object parts for weakly supervised affordance grounding","venue":null,"work_id":"0315ca0c-ad89-447c-bd73-f6fe445164e4","year":2023},"citing_paper":{"arxiv_id":"2509.00385","last_updated":"2025-08-30T06:50:49Z","snapshot_observed_at":"2026-08-10T11:34:20.945815Z","submitted_at":"2025-08-30T06:50:49Z","title":"HERO-VQL: Hierarchical, Egocentric and Robust Visual Query Localization","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:09.584010Z"},"links":{"citing_paper":"/paper/2509.00385"},"observation_digest":"sha256:73a27482bed12f1efdd578af95bbe995d448b6729667937ce616df77d0569559","observation_id":"03420ebd-cf17-4354-b52c-5367e2d3ef11","resolution":{"observed_at":"2026-08-05T13:44:18.313653Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:44:18.059408Z","title":"Tsm: Temporal shift module for efficient video understanding","venue":null,"work_id":"3b4892ce-19dc-4108-930a-9a06e562fcda","year":2019},"citing_paper":{"arxiv_id":"2509.00385","last_updated":"2025-08-30T06:50:49Z","snapshot_observed_at":"2026-08-10T11:34:20.945815Z","submitted_at":"2025-08-30T06:50:49Z","title":"HERO-VQL: Hierarchical, Egocentric and Robust Visual Query Localization","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:09.719343Z"},"links":{"citing_paper":"/paper/2509.00385"},"observation_digest":"sha256:8b45f4d9c5cb4ca6a13ac503df1755b9e7e29a85f0e7ee6f2f87dbcbfea05b55","observation_id":"e139906a-7062-4fbf-a8db-ba4a5453ccc0","resolution":{"observed_at":"2026-08-05T13:44:18.121464Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1708.02002","last_updated":"2018-02-07T18:44:44Z","snapshot_observed_at":"2026-07-06T05:54:18.908943Z","submitted_at":"2017-08-07T06:32:42Z","title":"Focal Loss for Dense Object Detection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1708.02002","snapshot_observed_at":"2026-08-05T13:44:09.854460Z","title":"Focal loss for dense object detection","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.00385","last_updated":"2025-08-30T06:50:49Z","snapshot_observed_at":"2026-08-10T11:34:20.945815Z","submitted_at":"2025-08-30T06:50:49Z","title":"HERO-VQL: Hierarchical, Egocentric and Robust Visual Query Localization","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:09.854460Z"},"links":{"cited_paper":"/paper/1708.02002","citing_paper":"/paper/2509.00385"},"observation_digest":"sha256:40a535dab2b8393d23c39970f466e665faab01765fccc5789f4555d56dfdedb5","observation_id":"d98ab12c-15de-42b4-af99-8e4fd2b492e3","resolution":{"observed_at":"2026-08-05T13:44:09.854460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:44:09.925615Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.00385","last_updated":"2025-08-30T06:50:49Z","snapshot_observed_at":"2026-08-10T11:34:20.945815Z","submitted_at":"2025-08-30T06:50:49Z","title":"HERO-VQL: Hierarchical, Egocentric and Robust Visual Query Localization","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:09.925615Z"},"links":{"citing_paper":"/paper/2509.00385"},"observation_digest":"sha256:cf7a1cac41a2789bb05bb0220dc98ddc070479d0b26ff923d861436bdd9750b3","observation_id":"3127d551-e6a9-4621-a396-6f5d12ad81a0","resolution":{"observed_at":"2026-08-05T13:44:09.925615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:44:17.865935Z","title":"Egoloc: Revisiting 3d object localization from egocentric videos with visual queries","venue":null,"work_id":"b134ea09-84df-4ab3-b9ce-893ae707f0fc","year":2023},"citing_paper":{"arxiv_id":"2509.00385","last_updated":"2025-08-30T06:50:49Z","snapshot_observed_at":"2026-08-10T11:34:20.945815Z","submitted_at":"2025-08-30T06:50:49Z","title":"HERO-VQL: Hierarchical, Egocentric and Robust Visual Query Localization","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:10.007376Z"},"links":{"citing_paper":"/paper/2509.00385"},"observation_digest":"sha256:fbc35b9b3d62604543115c1b9faef9c9e3f7fc1d8aa15b748a90b794b3fc4759","observation_id":"42491b24-cee6-4f2d-bfea-efced078276f","resolution":{"observed_at":"2026-08-05T13:44:17.959933Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:44:17.632071Z","title":null,"venue":null,"work_id":"5ed2ab14-71b4-4faf-9715-e64f8682b8f5","year":2024},"citing_paper":{"arxiv_id":"2509.00385","last_updated":"2025-08-30T06:50:49Z","snapshot_observed_at":"2026-08-10T11:34:20.945815Z","submitted_at":"2025-08-30T06:50:49Z","title":"HERO-VQL: Hierarchical, Egocentric and Robust Visual Query Localization","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:10.127017Z"},"links":{"citing_paper":"/paper/2509.00385"},"observation_digest":"sha256:80342646c6ecea1145d1275e7bc0535c3fc219c41cc6fde05a95f32aae24ebfd","observation_id":"f40b9bea-30c4-48a1-bc1e-795bf7afb049","resolution":{"observed_at":"2026-08-05T13:44:17.769270Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:44:17.361664Z","title":"Automatic differentiation in pytorch","venue":null,"work_id":"cc415f07-928c-40e5-8d23-80a62b523cb5","year":2017},"citing_paper":{"arxiv_id":"2509.00385","last_updated":"2025-08-30T06:50:49Z","snapshot_observed_at":"2026-08-10T11:34:20.945815Z","submitted_at":"2025-08-30T06:50:49Z","title":"HERO-VQL: Hierarchical, Egocentric and Robust Visual Query Localization","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:10.233579Z"},"links":{"citing_paper":"/paper/2509.00385"},"observation_digest":"sha256:6ca2efeffd21e01122b01742b79258b4fd819ca37539371913f1a58bd674d452","observation_id":"4879726a-6586-4091-9f6a-00fb1b74ba2b","resolution":{"observed_at":"2026-08-05T13:44:17.504074Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:44:17.125525Z","title":"Learning transferable visual models from natural lan- guage supervision","venue":null,"work_id":"72647235-1bd3-4a1c-918e-2ca95b00950f","year":2021},"citing_paper":{"arxiv_id":"2509.00385","last_updated":"2025-08-30T06:50:49Z","snapshot_observed_at":"2026-08-10T11:34:20.945815Z","submitted_at":"2025-08-30T06:50:49Z","title":"HERO-VQL: Hierarchical, Egocentric and Robust Visual Query Localization","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:10.339632Z"},"links":{"citing_paper":"/paper/2509.00385"},"observation_digest":"sha256:f1155b8969a4886697f651b9af824964a05f0fd539cad6a078aa6885ab6f05b0","observation_id":"85a9426d-3582-4209-bbc1-ec20eab8d36e","resolution":{"observed_at":"2026-08-05T13:44:17.255306Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:44:16.861892Z","title":"Generalized intersection over union: A metric and a loss for bounding box regression","venue":null,"work_id":"d162b783-1a3e-4ac0-ac01-6c9908855b1e","year":2019},"citing_paper":{"arxiv_id":"2509.00385","last_updated":"2025-08-30T06:50:49Z","snapshot_observed_at":"2026-08-10T11:34:20.945815Z","submitted_at":"2025-08-30T06:50:49Z","title":"HERO-VQL: Hierarchical, Egocentric and Robust Visual Query Localization","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:10.464720Z"},"links":{"citing_paper":"/paper/2509.00385"},"observation_digest":"sha256:1d3cb25cbc08b70de2a3336a3f3f2c333ccb584a2ee26e791549a6ec2b15234f","observation_id":"d4826698-af89-4e3e-9487-c778104a23b4","resolution":{"observed_at":"2026-08-05T13:44:16.974537Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:44:16.559221Z","title":"Ego4d goal-step: Toward hierarchical understanding of procedural activities","venue":null,"work_id":"3f0efc8e-8222-4ff3-ad66-a63e3720f522","year":2023},"citing_paper":{"arxiv_id":"2509.00385","last_updated":"2025-08-30T06:50:49Z","snapshot_observed_at":"2026-08-10T11:34:20.945815Z","submitted_at":"2025-08-30T06:50:49Z","title":"HERO-VQL: Hierarchical, Egocentric and Robust Visual Query Localization","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:10.553235Z"},"links":{"citing_paper":"/paper/2509.00385"},"observation_digest":"sha256:2ea0ff905daeda7c83bc9b491c555c101ebcab7ae46488d442b7bd06d36ff285","observation_id":"64db5430-329e-428c-af1c-03fbb1b5f17a","resolution":{"observed_at":"2026-08-05T13:44:16.713470Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:44:16.287325Z","title":"Transformer tracking with cyclic shifting window attention","venue":null,"work_id":"6c386c9b-86ea-492e-9839-147fc7b30014","year":2022},"citing_paper":{"arxiv_id":"2509.00385","last_updated":"2025-08-30T06:50:49Z","snapshot_observed_at":"2026-08-10T11:34:20.945815Z","submitted_at":"2025-08-30T06:50:49Z","title":"HERO-VQL: Hierarchical, Egocentric and Robust Visual Query Localization","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:10.689444Z"},"links":{"citing_paper":"/paper/2509.00385"},"observation_digest":"sha256:daac99146e34258f6eb4f2876f1c5d68b4673039a637d248ec25105f32166b05","observation_id":"470e1544-6890-4837-aa64-bec31f640e2e","resolution":{"observed_at":"2026-08-05T13:44:16.398256Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:44:15.983462Z","title":"Egotracks: A long-term ego- centric visual object tracking dataset","venue":null,"work_id":"52ede72d-4710-46b0-b12c-c4c7b2596c1f","year":2023},"citing_paper":{"arxiv_id":"2509.00385","last_updated":"2025-08-30T06:50:49Z","snapshot_observed_at":"2026-08-10T11:34:20.945815Z","submitted_at":"2025-08-30T06:50:49Z","title":"HERO-VQL: Hierarchical, Egocentric and Robust Visual Query Localization","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:10.804582Z"},"links":{"citing_paper":"/paper/2509.00385"},"observation_digest":"sha256:881a90d7177b8392af8ddd69fc1a075c4ac9a5a4dba79733ef67e2b06be87025","observation_id":"5a3b8773-967c-44e0-bc4d-9361f4df6ba2","resolution":{"observed_at":"2026-08-05T13:44:16.158694Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:44:15.676399Z","title":"Shazeer, Niki Parmar, Jakob Uszkoreit, Llion Jones, Aidan N","venue":null,"work_id":"23c21206-df47-4da4-ab24-c1fab4e0cb9e","year":2017},"citing_paper":{"arxiv_id":"2509.00385","last_updated":"2025-08-30T06:50:49Z","snapshot_observed_at":"2026-08-10T11:34:20.945815Z","submitted_at":"2025-08-30T06:50:49Z","title":"HERO-VQL: Hierarchical, Egocentric and Robust Visual Query Localization","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:10.913351Z"},"links":{"citing_paper":"/paper/2509.00385"},"observation_digest":"sha256:168ec358ad48972a76b5e8deb2a0cc5e8cca89af67b47981797c43385b5fc655","observation_id":"7e0419b4-3965-47af-a959-244040339b93","resolution":{"observed_at":"2026-08-05T13:44:15.823631Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.01949","last_updated":"2022-08-03T09:54:51Z","snapshot_observed_at":"2026-08-05T23:02:25.468381Z","submitted_at":"2022-08-03T09:54:51Z","title":"Negative Frames Matter in Egocentric Visual Query 2D Localization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.01949","snapshot_observed_at":"2026-08-05T13:44:10.998462Z","title":"Negative frames matter in egocentric visual query 2d localization","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.00385","last_updated":"2025-08-30T06:50:49Z","snapshot_observed_at":"2026-08-10T11:34:20.945815Z","submitted_at":"2025-08-30T06:50:49Z","title":"HERO-VQL: Hierarchical, Egocentric and Robust Visual Query Localization","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:10.998462Z"},"links":{"cited_paper":"/paper/2208.01949","citing_paper":"/paper/2509.00385"},"observation_digest":"sha256:ef5d5c8079132ff99dd603cf2fdf0df4f49aa89a23d87cec92d07eec1809b1a1","observation_id":"dd0b0736-cdbc-4311-b480-7b67f4216ead","resolution":{"observed_at":"2026-08-05T13:44:10.998462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:44:15.392993Z","title":"Where is my wallet? modeling object proposal sets for egocentric visual query localization","venue":null,"work_id":"dd6566ba-5076-40d1-85da-b3c26b1866b8","year":2023},"citing_paper":{"arxiv_id":"2509.00385","last_updated":"2025-08-30T06:50:49Z","snapshot_observed_at":"2026-08-10T11:34:20.945815Z","submitted_at":"2025-08-30T06:50:49Z","title":"HERO-VQL: Hierarchical, Egocentric and Robust Visual Query Localization","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:11.100684Z"},"links":{"citing_paper":"/paper/2509.00385"},"observation_digest":"sha256:fc4022672473cb2ee6375501d480572153c67a6cd7d4ad05ec08d163a5a122e4","observation_id":"1c20528b-4039-4574-99cf-8dc14772d849","resolution":{"observed_at":"2026-08-05T13:44:15.520003Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:44:15.033973Z","title":"Learning spatio- temporal transformer for visual tracking","venue":null,"work_id":"7f8a5a00-d63c-4507-9657-f41d0e52d3be","year":2021},"citing_paper":{"arxiv_id":"2509.00385","last_updated":"2025-08-30T06:50:49Z","snapshot_observed_at":"2026-08-10T11:34:20.945815Z","submitted_at":"2025-08-30T06:50:49Z","title":"HERO-VQL: Hierarchical, Egocentric and Robust Visual Query Localization","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:11.202670Z"},"links":{"citing_paper":"/paper/2509.00385"},"observation_digest":"sha256:ec3f572810e1a9cb57d6675ce03cb3a70ef28f656a4ceda7e4b1d017ec846614","observation_id":"9d5731d0-85bc-4b8f-98b6-1cdebb4800da","resolution":{"observed_at":"2026-08-05T13:44:15.214035Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.11922","last_updated":"2024-11-30T22:32:34Z","snapshot_observed_at":"2026-08-08T21:51:38.855361Z","submitted_at":"2024-11-18T05:59:03Z","title":"SAMURAI: Adapting Segment Anything Model for Zero-Shot Visual Tracking with Motion-Aware Memory","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.11922","snapshot_observed_at":"2026-08-05T13:44:11.339769Z","title":"Samurai: Adapting segment anything model for zero-shot visual tracking with motion-aware memory","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00385","last_updated":"2025-08-30T06:50:49Z","snapshot_observed_at":"2026-08-10T11:34:20.945815Z","submitted_at":"2025-08-30T06:50:49Z","title":"HERO-VQL: Hierarchical, Egocentric and Robust Visual Query Localization","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:11.339769Z"},"links":{"cited_paper":"/paper/2411.11922","citing_paper":"/paper/2509.00385"},"observation_digest":"sha256:cce998645e28fdde363542830adcd8ea9ccbe95bb17c049c188d3bbb5c94cee6","observation_id":"a3f02956-f0d1-4161-862a-3e1a2bff626e","resolution":{"observed_at":"2026-08-05T13:44:11.339769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:44:14.674775Z","title":"Self- produced guidance for weakly-supervised object localization","venue":null,"work_id":"a513aaed-fa59-4cb2-b95f-27ff35f2d767","year":2018},"citing_paper":{"arxiv_id":"2509.00385","last_updated":"2025-08-30T06:50:49Z","snapshot_observed_at":"2026-08-10T11:34:20.945815Z","submitted_at":"2025-08-30T06:50:49Z","title":"HERO-VQL: Hierarchical, Egocentric and Robust Visual Query Localization","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:11.451191Z"},"links":{"citing_paper":"/paper/2509.00385"},"observation_digest":"sha256:102f001a1af674511c172e6e2d600078820aa7c611d6001c64b2190865f786bc","observation_id":"da666d6d-bb6c-491f-a3ca-8ae12c6e387d","resolution":{"observed_at":"2026-08-05T13:44:14.842946Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:44:14.355229Z","title":"Visual prompt multi-modal tracking","venue":null,"work_id":"821d2b72-3697-487c-89a3-d5a7a1bb11e2","year":2023},"citing_paper":{"arxiv_id":"2509.00385","last_updated":"2025-08-30T06:50:49Z","snapshot_observed_at":"2026-08-10T11:34:20.945815Z","submitted_at":"2025-08-30T06:50:49Z","title":"HERO-VQL: Hierarchical, Egocentric and Robust Visual Query Localization","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:11.558759Z"},"links":{"citing_paper":"/paper/2509.00385"},"observation_digest":"sha256:74b61af1d3a80d7db658c6aa9e13bc16dbfb57ce7a60b8d166205ca132a3cf57","observation_id":"13bc24c7-c175-46f4-81c8-73c7afcb2268","resolution":{"observed_at":"2026-08-05T13:44:14.487317Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:44:14.115606Z","title":null,"venue":null,"work_id":"c5d5d66b-a466-4211-9e93-fc6e6d2d64e7","year":null},"citing_paper":{"arxiv_id":"2509.00385","last_updated":"2025-08-30T06:50:49Z","snapshot_observed_at":"2026-08-10T11:34:20.945815Z","submitted_at":"2025-08-30T06:50:49Z","title":"HERO-VQL: Hierarchical, Egocentric and Robust Visual Query Localization","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:11.659970Z"},"links":{"citing_paper":"/paper/2509.00385"},"observation_digest":"sha256:a8f06486116bbcd982af2348cfa1e7bb88204c3d4594d619891902aa785b94c1","observation_id":"90026469-bfad-4f15-973f-80d3446a6271","resolution":{"observed_at":"2026-08-05T13:44:14.239291Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:44:13.856085Z","title":null,"venue":null,"work_id":"35d14fff-61db-4aef-aaec-e326122101d5","year":null},"citing_paper":{"arxiv_id":"2509.00385","last_updated":"2025-08-30T06:50:49Z","snapshot_observed_at":"2026-08-10T11:34:20.945815Z","submitted_at":"2025-08-30T06:50:49Z","title":"HERO-VQL: Hierarchical, Egocentric and Robust Visual Query Localization","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:11.756374Z"},"links":{"citing_paper":"/paper/2509.00385"},"observation_digest":"sha256:63fea23fbc00a1d86195bf0be3af9dc2b19fea152f5c0d9d5bd95fca8531ecc8","observation_id":"12ca8d7c-cdc2-4076-9c5b-f98bf761c449","resolution":{"observed_at":"2026-08-05T13:44:13.991415Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:44:13.637893Z","title":"Details VQ2D dataset is a large-scale egocentric video dataset for localization that con- tains about 6K clips","venue":null,"work_id":"5d6a946d-e340-410d-b7b7-368fc8d34c5b","year":null},"citing_paper":{"arxiv_id":"2509.00385","last_updated":"2025-08-30T06:50:49Z","snapshot_observed_at":"2026-08-10T11:34:20.945815Z","submitted_at":"2025-08-30T06:50:49Z","title":"HERO-VQL: Hierarchical, Egocentric and Robust Visual Query Localization","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:11.927514Z"},"links":{"citing_paper":"/paper/2509.00385"},"observation_digest":"sha256:0c2d8656b1b749283c2af4544ef329ccb8b6b22ff6701cac1b92a76312c67140","observation_id":"c6670d0c-21fd-48ae-ae32-62616bf549d6","resolution":{"observed_at":"2026-08-05T13:44:13.773988Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:44:13.441342Z","title":"Specifically, we evaluate tAP25 at a tIoU threshold of 0.25, indicating how well the predicted temporal boundaries align with the ground truth","venue":null,"work_id":"73b82422-8c08-41ca-914b-1e66f7a32fc8","year":null},"citing_paper":{"arxiv_id":"2509.00385","last_updated":"2025-08-30T06:50:49Z","snapshot_observed_at":"2026-08-10T11:34:20.945815Z","submitted_at":"2025-08-30T06:50:49Z","title":"HERO-VQL: Hierarchical, Egocentric and Robust Visual Query Localization","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:12.068369Z"},"links":{"citing_paper":"/paper/2509.00385"},"observation_digest":"sha256:70d43a9c206cfaf36c664fdf642383b3a4570712d2144976a87a82461e1343bb","observation_id":"4a25a988-2c15-4309-b67d-eb402c8b1314","resolution":{"observed_at":"2026-08-05T13:44:13.579042Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:44:13.139379Z","title":"This metric measures the overlap between the predicted and ground-truth spatio-temporal volumes, capturing both spatial accu- racy and temporal alignment","venue":null,"work_id":"3695b6f7-7c75-4b96-a240-fd1ac305018e","year":null},"citing_paper":{"arxiv_id":"2509.00385","last_updated":"2025-08-30T06:50:49Z","snapshot_observed_at":"2026-08-10T11:34:20.945815Z","submitted_at":"2025-08-30T06:50:49Z","title":"HERO-VQL: Hierarchical, Egocentric and Robust Visual Query Localization","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:12.219216Z"},"links":{"citing_paper":"/paper/2509.00385"},"observation_digest":"sha256:28be6a8046e7bde94553ae45a3373d3edef1a722b407c390420de829a2f5bfba","observation_id":"97438272-4156-4725-b16b-9459b82bf02b","resolution":{"observed_at":"2026-08-05T13:44:13.305418Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:44:12.925194Z","title":"For a frame to be considered correctly recovered, the spatial IoU between the prediction and ground truth must exceed 0.5","venue":null,"work_id":"e654f615-3a9b-4b09-9aa8-18332a399b09","year":null},"citing_paper":{"arxiv_id":"2509.00385","last_updated":"2025-08-30T06:50:49Z","snapshot_observed_at":"2026-08-10T11:34:20.945815Z","submitted_at":"2025-08-30T06:50:49Z","title":"HERO-VQL: Hierarchical, Egocentric and Robust Visual Query Localization","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:12.347036Z"},"links":{"citing_paper":"/paper/2509.00385"},"observation_digest":"sha256:5b8765df148a6befc00ab97f3ab4091473c6a324e25abbbbd5cdbb12b8415fff","observation_id":"067c9ae1-33ef-4ec2-b5e6-996547153096","resolution":{"observed_at":"2026-08-05T13:44:13.053744Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:44:12.704076Z","title":"This metric empha- sizes identifying whether the prediction captures even a minimal level of overlap with the ground truth","venue":null,"work_id":"fb932b2a-514f-4da9-b565-421ccf145d96","year":null},"citing_paper":{"arxiv_id":"2509.00385","last_updated":"2025-08-30T06:50:49Z","snapshot_observed_at":"2026-08-10T11:34:20.945815Z","submitted_at":"2025-08-30T06:50:49Z","title":"HERO-VQL: Hierarchical, Egocentric and Robust Visual Query Localization","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:12.467300Z"},"links":{"citing_paper":"/paper/2509.00385"},"observation_digest":"sha256:cd287478ab9e82639d11a1cd3329a4ce03a4436faa1a389bca0d9dc708f80f44","observation_id":"dc7c431a-2ac4-4e66-a2eb-72a7f08140ec","resolution":{"observed_at":"2026-08-05T13:44:12.787893Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2509.00385","last_updated":"2025-08-30T06:50:49Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-10T11:34:20.945815Z","submitted_at":"2025-08-30T06:50:49Z","title":"HERO-VQL: Hierarchical, Egocentric and Robust Visual Query Localization"},"reference_resolution":{"displayed":52,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":12,"verified_exact":0,"verified_fuzzy":39},"total_outbound_references":52},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 52 of 52 outbound references and 0 inbound Pith citation observations for arXiv:2509.00385."}