{"as_of":"2026-08-09T22:49:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7b5c616809f038ce8a47870a72e324ec8492460082809e4a5757b3256628ea9b","coverage":[{"denominator":40,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-10T06:09:11.411036Z","state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.08514/citation-record","integrity":"/paper/2607.08514/integrity","json":"/paper/2607.08514/citation-record.json","paper":"/paper/2607.08514"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T06:16:52.198068Z","title":"In: European conference on computer vision","venue":null,"work_id":"60b889c7-02d9-463c-8ad1-4c420200bdc8","year":2020},"citing_paper":{"arxiv_id":"2607.08514","last_updated":"2026-07-09T14:09:29Z","snapshot_observed_at":"2026-08-07T11:00:41.421126Z","submitted_at":"2026-07-09T14:09:29Z","title":"Do Egocentric Video-Language Models Capture Both Hand- and Object-Centric Cues?","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-10T06:09:11.411036Z"},"links":{"citing_paper":"/paper/2607.08514"},"observation_digest":"sha256:91c36119244942c99c79170fb7e95f9a99b1788a0803baaa31a437cfb86334e9","observation_id":"48d41b6f-a223-458b-92c1-89daa1273c4a","resolution":{"observed_at":"2026-07-10T06:16:52.201988Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T06:16:52.212499Z","title":"In: ECCV","venue":null,"work_id":"6160a39b-d851-47d3-8916-ae7b197db228","year":2018},"citing_paper":{"arxiv_id":"2607.08514","last_updated":"2026-07-09T14:09:29Z","snapshot_observed_at":"2026-08-07T11:00:41.421126Z","submitted_at":"2026-07-09T14:09:29Z","title":"Do Egocentric Video-Language Models Capture Both Hand- and Object-Centric Cues?","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-10T06:09:11.411036Z"},"links":{"citing_paper":"/paper/2607.08514"},"observation_digest":"sha256:d7c350bf352723d194fd6282f6f987ca0d2930891cffffd2eab8ca12429265ca","observation_id":"3c59707f-9f64-416d-8830-acb2746d6e7a","resolution":{"observed_at":"2026-07-10T06:16:52.214739Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T06:16:52.205961Z","title":"International Journal of Computer Vision130(1), 33–55 (2022)","venue":null,"work_id":"ca674e41-092b-4293-810d-74b4a9b82fd3","year":2022},"citing_paper":{"arxiv_id":"2607.08514","last_updated":"2026-07-09T14:09:29Z","snapshot_observed_at":"2026-08-07T11:00:41.421126Z","submitted_at":"2026-07-09T14:09:29Z","title":"Do Egocentric Video-Language Models Capture Both Hand- and Object-Centric Cues?","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-10T06:09:11.411036Z"},"links":{"citing_paper":"/paper/2607.08514"},"observation_digest":"sha256:1886050b8728c2303142ac738c656985b80d4264e814bf5500e5e616c556ef4e","observation_id":"8724cb82-cb4a-4608-884d-c81ed38e2e2d","resolution":{"observed_at":"2026-07-10T06:16:52.209988Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T06:16:52.215968Z","title":"NeurIPS35, 13745–13758 (2022)","venue":null,"work_id":"76bac0a4-f02b-4e65-90a3-4aad9f90581d","year":2022},"citing_paper":{"arxiv_id":"2607.08514","last_updated":"2026-07-09T14:09:29Z","snapshot_observed_at":"2026-08-07T11:00:41.421126Z","submitted_at":"2026-07-09T14:09:29Z","title":"Do Egocentric Video-Language Models Capture Both Hand- and Object-Centric Cues?","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-10T06:09:11.411036Z"},"links":{"citing_paper":"/paper/2607.08514"},"observation_digest":"sha256:e56e2528e1ab9dc6ba762dce074dce3ca5c4528e633c2cd9d6342132782505ab","observation_id":"d1fbd3c1-52d5-4656-a12b-a69301a6cee0","resolution":{"observed_at":"2026-07-10T06:16:52.218490Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T06:16:52.220911Z","title":"In: European Conference on Computer Vision","venue":null,"work_id":"5f5bb386-b0c8-40fd-ab99-b107bd6e77f7","year":2024},"citing_paper":{"arxiv_id":"2607.08514","last_updated":"2026-07-09T14:09:29Z","snapshot_observed_at":"2026-08-07T11:00:41.421126Z","submitted_at":"2026-07-09T14:09:29Z","title":"Do Egocentric Video-Language Models Capture Both Hand- and Object-Centric Cues?","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-10T06:09:11.411036Z"},"links":{"citing_paper":"/paper/2607.08514"},"observation_digest":"sha256:55231b750a61339ad84d0818677b4f62a1a314049f5d8f649e3958a884acbf81","observation_id":"da35563d-b37e-41fb-b2db-a72f3951777d","resolution":{"observed_at":"2026-07-10T06:16:52.223179Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T06:16:52.256481Z","title":"In: ICCV","venue":null,"work_id":"114eba54-0781-4326-9b01-55219deeb9b2","year":2023},"citing_paper":{"arxiv_id":"2607.08514","last_updated":"2026-07-09T14:09:29Z","snapshot_observed_at":"2026-08-07T11:00:41.421126Z","submitted_at":"2026-07-09T14:09:29Z","title":"Do Egocentric Video-Language Models Capture Both Hand- and Object-Centric Cues?","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-10T06:09:11.411036Z"},"links":{"citing_paper":"/paper/2607.08514"},"observation_digest":"sha256:f9e68e62f021432b679d4ffba80770f69f65565321dd19016a31c3569e20fc1c","observation_id":"06c290ed-7dff-48db-8570-6584708c85f3","resolution":{"observed_at":"2026-07-10T06:16:52.259553Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T06:16:52.157203Z","title":"NeurIPS35, 35946–35958 (2022)","venue":null,"work_id":"85301ba1-edfd-4d31-a664-5e020510a3bd","year":2022},"citing_paper":{"arxiv_id":"2607.08514","last_updated":"2026-07-09T14:09:29Z","snapshot_observed_at":"2026-08-07T11:00:41.421126Z","submitted_at":"2026-07-09T14:09:29Z","title":"Do Egocentric Video-Language Models Capture Both Hand- and Object-Centric Cues?","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-10T06:09:11.411036Z"},"links":{"citing_paper":"/paper/2607.08514"},"observation_digest":"sha256:9415dc2c34b96f86d39748d0075191ccadfdcc16a577782f7d769c17892d1ac2","observation_id":"f54e2fe2-f55a-493d-8be8-cda365d5f58f","resolution":{"observed_at":"2026-07-10T06:16:52.158762Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T06:16:52.169664Z","title":"In: WACV","venue":null,"work_id":"26a293e2-86f1-4f3b-80eb-de11007aaddf","year":2025},"citing_paper":{"arxiv_id":"2607.08514","last_updated":"2026-07-09T14:09:29Z","snapshot_observed_at":"2026-08-07T11:00:41.421126Z","submitted_at":"2026-07-09T14:09:29Z","title":"Do Egocentric Video-Language Models Capture Both Hand- and Object-Centric Cues?","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-10T06:09:11.411036Z"},"links":{"citing_paper":"/paper/2607.08514"},"observation_digest":"sha256:06cad3d7d3a56695a19401227608402e378c33a73b4f75eb6d6965160bf6372c","observation_id":"eb4c999d-983f-4d4a-8b3a-0773fcbace08","resolution":{"observed_at":"2026-07-10T06:16:52.171490Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T06:16:52.169646Z","title":"something something","venue":null,"work_id":"00543647-6547-4c6d-9723-a921f1ad366d","year":2017},"citing_paper":{"arxiv_id":"2607.08514","last_updated":"2026-07-09T14:09:29Z","snapshot_observed_at":"2026-08-07T11:00:41.421126Z","submitted_at":"2026-07-09T14:09:29Z","title":"Do Egocentric Video-Language Models Capture Both Hand- and Object-Centric Cues?","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-10T06:09:11.411036Z"},"links":{"citing_paper":"/paper/2607.08514"},"observation_digest":"sha256:b1c2885da7fa61670732126bc9d529e351241c043f2079ccfbd4e769fb504123","observation_id":"bffba022-d754-4979-bedc-d6dea36787c7","resolution":{"observed_at":"2026-07-10T06:16:52.171481Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T06:16:52.172351Z","title":"In: CVPR","venue":null,"work_id":"4a6b8ca6-6a33-4e11-86d7-ce98964c5625","year":2022},"citing_paper":{"arxiv_id":"2607.08514","last_updated":"2026-07-09T14:09:29Z","snapshot_observed_at":"2026-08-07T11:00:41.421126Z","submitted_at":"2026-07-09T14:09:29Z","title":"Do Egocentric Video-Language Models Capture Both Hand- and Object-Centric Cues?","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-10T06:09:11.411036Z"},"links":{"citing_paper":"/paper/2607.08514"},"observation_digest":"sha256:acf589dc0e9cc0a9eaa576a360b939cc74ecbc210c613488547bc229e1abe2bd","observation_id":"bd43a4c4-e1f5-4820-99b8-8b48eb068c74","resolution":{"observed_at":"2026-07-10T06:16:52.173896Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T06:16:52.181761Z","title":"In: CVPR","venue":null,"work_id":"09a6bf0e-2430-409f-aed8-b773637fdea7","year":2021},"citing_paper":{"arxiv_id":"2607.08514","last_updated":"2026-07-09T14:09:29Z","snapshot_observed_at":"2026-08-07T11:00:41.421126Z","submitted_at":"2026-07-09T14:09:29Z","title":"Do Egocentric Video-Language Models Capture Both Hand- and Object-Centric Cues?","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-10T06:09:11.411036Z"},"links":{"citing_paper":"/paper/2607.08514"},"observation_digest":"sha256:44cb9feffc825eb3174687cfc4d9f0d8704f718159813c5154b67f201ae71fce","observation_id":"8fe99ac5-8ded-4ac0-a61d-98e4125c1748","resolution":{"observed_at":"2026-07-10T06:16:52.182992Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T06:16:52.146765Z","title":"ICLR1(2), 3 (2022)","venue":null,"work_id":"f84bfeb2-645f-4da8-b913-48ba34dfdc3e","year":2022},"citing_paper":{"arxiv_id":"2607.08514","last_updated":"2026-07-09T14:09:29Z","snapshot_observed_at":"2026-08-07T11:00:41.421126Z","submitted_at":"2026-07-09T14:09:29Z","title":"Do Egocentric Video-Language Models Capture Both Hand- and Object-Centric Cues?","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-10T06:09:11.411036Z"},"links":{"citing_paper":"/paper/2607.08514"},"observation_digest":"sha256:19473ff006eab7637391112854f059bb46288af7c79ba31c70aae16344ebac8f","observation_id":"130b6e80-ea0d-42b2-9c27-284b2a4c345d","resolution":{"observed_at":"2026-07-10T06:16:52.148146Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T06:16:52.149140Z","title":"In: ICCV","venue":null,"work_id":"60435ed1-81ce-4757-8501-9f3717fba495","year":2023},"citing_paper":{"arxiv_id":"2607.08514","last_updated":"2026-07-09T14:09:29Z","snapshot_observed_at":"2026-08-07T11:00:41.421126Z","submitted_at":"2026-07-09T14:09:29Z","title":"Do Egocentric Video-Language Models Capture Both Hand- and Object-Centric Cues?","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-10T06:09:11.411036Z"},"links":{"citing_paper":"/paper/2607.08514"},"observation_digest":"sha256:68efed3a4446e9be4963ad751ff3d2ec622b8f406dc657ab49319f4dcb4bfde4","observation_id":"5b097368-fe80-4d70-80a7-a03886ca1082","resolution":{"observed_at":"2026-07-10T06:16:52.151199Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12945","last_updated":"2025-04-22T17:57:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-19T17:48:38Z","title":"DROID: A Large-Scale In-The-Wild Robot Manipulation Dataset","version":2},"cited_work":{"arxiv_id":"2403.12945","doi":"10.48550/arxiv.2403.12945","metadata_source":"pith","pith_arxiv_id":"2403.12945","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DROID: A Large-Scale In-The-Wild Robot Manipulation Dataset","venue":"cs.RO","work_id":"13253de2-3d89-415c-8c2f-3adb25d4c337","year":2024},"citing_paper":{"arxiv_id":"2607.08514","last_updated":"2026-07-09T14:09:29Z","snapshot_observed_at":"2026-08-07T11:00:41.421126Z","submitted_at":"2026-07-09T14:09:29Z","title":"Do Egocentric Video-Language Models Capture Both Hand- and Object-Centric Cues?","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-10T06:09:11.411036Z"},"links":{"cited_paper":"/paper/2403.12945","citing_paper":"/paper/2607.08514"},"observation_digest":"sha256:9e004607c594f510c4ada72f76ae0c72c1dbbf63adb99d064722f387c243e280","observation_id":"357060b2-a3d5-47cf-b873-b606a46dc3ba","resolution":{"observed_at":"2026-07-10T06:16:51.322147Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T06:16:52.131856Z","title":"In: ECCV","venue":null,"work_id":"77ad7847-298c-4948-8710-08ef85cdcc8a","year":2018},"citing_paper":{"arxiv_id":"2607.08514","last_updated":"2026-07-09T14:09:29Z","snapshot_observed_at":"2026-08-07T11:00:41.421126Z","submitted_at":"2026-07-09T14:09:29Z","title":"Do Egocentric Video-Language Models Capture Both Hand- and Object-Centric Cues?","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-10T06:09:11.411036Z"},"links":{"citing_paper":"/paper/2607.08514"},"observation_digest":"sha256:8d84f0fdca7ab6a89355276151f5e84fa7b411f113f18d382ef57c77a7c446fc","observation_id":"595d925d-b84f-4eea-94c6-bd0b44641bfe","resolution":{"observed_at":"2026-07-10T06:16:52.134335Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T06:16:52.135669Z","title":"NeurIPS35, 7575–7586 (2022)","venue":null,"work_id":"b3d9a8a5-3c92-4eff-a315-de6d8f87b68b","year":2022},"citing_paper":{"arxiv_id":"2607.08514","last_updated":"2026-07-09T14:09:29Z","snapshot_observed_at":"2026-08-07T11:00:41.421126Z","submitted_at":"2026-07-09T14:09:29Z","title":"Do Egocentric Video-Language Models Capture Both Hand- and Object-Centric Cues?","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-10T06:09:11.411036Z"},"links":{"citing_paper":"/paper/2607.08514"},"observation_digest":"sha256:fa3404deef2e9c7125ea399212af06fcf2b1efcb82db9558fccca235eb9ccc63","observation_id":"a11493bf-c6bc-44fc-b07e-02ec4c4840d1","resolution":{"observed_at":"2026-07-10T06:16:52.137267Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-09T20:34:52.923500Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":"1711.05101","doi":"10.1137/1.9781611972825.47","metadata_source":"pith","pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Decoupled Weight Decay Regularization","venue":"cs.LG","work_id":"07ef7360-d385-4033-83f7-8384a6325204","year":2017},"citing_paper":{"arxiv_id":"2607.08514","last_updated":"2026-07-09T14:09:29Z","snapshot_observed_at":"2026-08-07T11:00:41.421126Z","submitted_at":"2026-07-09T14:09:29Z","title":"Do Egocentric Video-Language Models Capture Both Hand- and Object-Centric Cues?","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-10T06:09:11.411036Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2607.08514"},"observation_digest":"sha256:f32d908336559946a984c6b5e9a05dc5cca6b8f95b72316dd2c41b754f558443","observation_id":"c1300fe6-c691-4da5-a400-0207af597f70","resolution":{"observed_at":"2026-07-10T06:16:51.319183Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T06:16:52.138300Z","title":"In: WACV","venue":null,"work_id":"e9f7f462-98f6-4695-9e5d-400b9ebbd44f","year":2026},"citing_paper":{"arxiv_id":"2607.08514","last_updated":"2026-07-09T14:09:29Z","snapshot_observed_at":"2026-08-07T11:00:41.421126Z","submitted_at":"2026-07-09T14:09:29Z","title":"Do Egocentric Video-Language Models Capture Both Hand- and Object-Centric Cues?","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-10T06:09:11.411036Z"},"links":{"citing_paper":"/paper/2607.08514"},"observation_digest":"sha256:e19dd196b0ee280832327200c92f2e3c4aefb8f970b1fd58d05ce6264ca380b1","observation_id":"9ab3e555-6068-4493-b596-b1d3df8aee49","resolution":{"observed_at":"2026-07-10T06:16:52.139915Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T06:16:52.152228Z","title":"In: ECCV (2018)","venue":null,"work_id":"706e877a-6c2a-4ca7-89da-928f6fcca609","year":2018},"citing_paper":{"arxiv_id":"2607.08514","last_updated":"2026-07-09T14:09:29Z","snapshot_observed_at":"2026-08-07T11:00:41.421126Z","submitted_at":"2026-07-09T14:09:29Z","title":"Do Egocentric Video-Language Models Capture Both Hand- and Object-Centric Cues?","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-10T06:09:11.411036Z"},"links":{"citing_paper":"/paper/2607.08514"},"observation_digest":"sha256:e3c8e156318740a802dea7cf0fab9a1659d6be5657e100515a05c8b88cc70280","observation_id":"a0976d70-d265-42b7-b03a-329e711b6d7b","resolution":{"observed_at":"2026-07-10T06:16:52.155419Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.00986","last_updated":"2025-03-02T18:49:48Z","snapshot_observed_at":"2026-08-07T17:35:32.512907Z","submitted_at":"2025-03-02T18:49:48Z","title":"Modeling Fine-Grained Hand-Object Dynamics for Egocentric Video Representation Learning","version":1},"cited_work":{"arxiv_id":"2503.00986","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.00986","snapshot_observed_at":"2026-07-10T06:16:51.314847Z","title":"Modeling fine-grained hand-object dynamics for egocentric video representation learning","venue":"cs.CV","work_id":"25d152fb-974a-4325-9a4d-80ec390cda0e","year":2025},"citing_paper":{"arxiv_id":"2607.08514","last_updated":"2026-07-09T14:09:29Z","snapshot_observed_at":"2026-08-07T11:00:41.421126Z","submitted_at":"2026-07-09T14:09:29Z","title":"Do Egocentric Video-Language Models Capture Both Hand- and Object-Centric Cues?","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-10T06:09:11.411036Z"},"links":{"cited_paper":"/paper/2503.00986","citing_paper":"/paper/2607.08514"},"observation_digest":"sha256:eb4df3038bfc89885d061fe9aa32002a4052268579c1311d8959f872b2dcf51a","observation_id":"c8cc51bf-d5df-490b-9b94-ff6fd326c2a2","resolution":{"observed_at":"2026-07-10T06:16:51.316359Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T06:16:52.122513Z","title":"In: CVPR","venue":null,"work_id":"abd7ecc3-5ed0-4620-ab65-7a423d6c9ea7","year":2025},"citing_paper":{"arxiv_id":"2607.08514","last_updated":"2026-07-09T14:09:29Z","snapshot_observed_at":"2026-08-07T11:00:41.421126Z","submitted_at":"2026-07-09T14:09:29Z","title":"Do Egocentric Video-Language Models Capture Both Hand- and Object-Centric Cues?","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-10T06:09:11.411036Z"},"links":{"citing_paper":"/paper/2607.08514"},"observation_digest":"sha256:8a595c2139873bbbfe637f1609eaf12d561fcea3d64e344e7801ab0e5e7776db","observation_id":"979c28c5-4d42-4db6-b658-e3ac4b5f46ef","resolution":{"observed_at":"2026-07-10T06:16:52.126422Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T06:16:52.128912Z","title":"In: ICCV","venue":null,"work_id":"2361e441-241d-4629-8627-2cecc9cab43f","year":2023},"citing_paper":{"arxiv_id":"2607.08514","last_updated":"2026-07-09T14:09:29Z","snapshot_observed_at":"2026-08-07T11:00:41.421126Z","submitted_at":"2026-07-09T14:09:29Z","title":"Do Egocentric Video-Language Models Capture Both Hand- and Object-Centric Cues?","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-10T06:09:11.411036Z"},"links":{"citing_paper":"/paper/2607.08514"},"observation_digest":"sha256:7e7afd0e5740fc2b04ca39e72c4ca44de392d979ead75a08071fa14f0b5790a6","observation_id":"ae71b54f-cc8f-4ed0-b085-68f8868e2fbe","resolution":{"observed_at":"2026-07-10T06:16:52.131283Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T22:47:44.272383Z","title":"In: International conference on machine learning","venue":null,"work_id":"69077c18-2906-43b3-9114-9a7539e22548","year":2021},"citing_paper":{"arxiv_id":"2607.08514","last_updated":"2026-07-09T14:09:29Z","snapshot_observed_at":"2026-08-07T11:00:41.421126Z","submitted_at":"2026-07-09T14:09:29Z","title":"Do Egocentric Video-Language Models Capture Both Hand- and Object-Centric Cues?","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-10T06:09:11.411036Z"},"links":{"citing_paper":"/paper/2607.08514"},"observation_digest":"sha256:7c4f0ec088b382f65c0300ea7ac8483c5a9bac7f36207b18cace67d0e40f91ba","observation_id":"925f0877-73f0-484f-853a-52d49cf7daf3","resolution":{"observed_at":"2026-07-10T06:16:52.144692Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":"2408.00714","doi":"10.1038/s41598-025-97590-3","metadata_source":"pith","pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SAM 2: Segment Anything in Images and Videos","venue":"cs.CV","work_id":"acc13f66-d814-44f9-9688-375688bf2d4a","year":2024},"citing_paper":{"arxiv_id":"2607.08514","last_updated":"2026-07-09T14:09:29Z","snapshot_observed_at":"2026-08-07T11:00:41.421126Z","submitted_at":"2026-07-09T14:09:29Z","title":"Do Egocentric Video-Language Models Capture Both Hand- and Object-Centric Cues?","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-10T06:09:11.411036Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2607.08514"},"observation_digest":"sha256:a955c3e1ac15854094f7f7d44467b1614dfa4953409af455262de07b5fec2c51","observation_id":"c7c2f8fb-7c38-4f60-96ef-5699902e9d37","resolution":{"observed_at":"2026-07-10T06:16:51.318769Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-05-24T04:24:23.885301+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T04:24:23.885301+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T06:16:52.194529Z","title":"In: CVPR","venue":null,"work_id":"b5bcb597-e857-4f95-b16e-34a5c79767fa","year":2022},"citing_paper":{"arxiv_id":"2607.08514","last_updated":"2026-07-09T14:09:29Z","snapshot_observed_at":"2026-08-07T11:00:41.421126Z","submitted_at":"2026-07-09T14:09:29Z","title":"Do Egocentric Video-Language Models Capture Both Hand- and Object-Centric Cues?","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-10T06:09:11.411036Z"},"links":{"citing_paper":"/paper/2607.08514"},"observation_digest":"sha256:c4fc8527650cc442bb9bb43b37a84d62f6d277e56de89ad8d9fa6550320cbd67","observation_id":"ccc53b70-b33e-4685-9830-d730da9840dc","resolution":{"observed_at":"2026-07-10T06:16:52.196544Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T06:16:52.267727Z","title":"In: CVPR","venue":null,"work_id":"5d664c48-2d13-421e-8624-8dbf0bf85667","year":2023},"citing_paper":{"arxiv_id":"2607.08514","last_updated":"2026-07-09T14:09:29Z","snapshot_observed_at":"2026-08-07T11:00:41.421126Z","submitted_at":"2026-07-09T14:09:29Z","title":"Do Egocentric Video-Language Models Capture Both Hand- and Object-Centric Cues?","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-10T06:09:11.411036Z"},"links":{"citing_paper":"/paper/2607.08514"},"observation_digest":"sha256:11047c1d85037813c248df73d5828b283f5ab3d3f0e165a43545994e1213c71f","observation_id":"516cc6c5-f109-4342-bf29-b37136f61fdf","resolution":{"observed_at":"2026-07-10T06:16:52.274091Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T06:16:52.248034Z","title":"In: CVPR","venue":null,"work_id":"9dd5aa78-9db3-47e5-816f-186d3414fead","year":2020},"citing_paper":{"arxiv_id":"2607.08514","last_updated":"2026-07-09T14:09:29Z","snapshot_observed_at":"2026-08-07T11:00:41.421126Z","submitted_at":"2026-07-09T14:09:29Z","title":"Do Egocentric Video-Language Models Capture Both Hand- and Object-Centric Cues?","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-10T06:09:11.411036Z"},"links":{"citing_paper":"/paper/2607.08514"},"observation_digest":"sha256:299bd5bddd043720a9b4af3e6f643309e16db9a09e9135a901db3905a679fc7c","observation_id":"67f358c1-5317-4475-8adf-c4d77aa59883","resolution":{"observed_at":"2026-07-10T06:16:52.251628Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T06:16:52.244048Z","title":"In: CVPR","venue":null,"work_id":"ea0f1b12-138c-4767-8232-095e00330c38","year":2022},"citing_paper":{"arxiv_id":"2607.08514","last_updated":"2026-07-09T14:09:29Z","snapshot_observed_at":"2026-08-07T11:00:41.421126Z","submitted_at":"2026-07-09T14:09:29Z","title":"Do Egocentric Video-Language Models Capture Both Hand- and Object-Centric Cues?","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-10T06:09:11.411036Z"},"links":{"citing_paper":"/paper/2607.08514"},"observation_digest":"sha256:5ab923d7f5ef3ff91a979940ec90cf46baea719531a738ef7ed0f7ca9eb503c7","observation_id":"9c3a9beb-9f63-4d6d-8521-35f79c5ee633","resolution":{"observed_at":"2026-07-10T06:16:52.246583Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T06:16:52.253858Z","title":"In: CVPR (2023)","venue":null,"work_id":"22f4c415-efd6-4f6b-be1c-a4e581ea2f57","year":2023},"citing_paper":{"arxiv_id":"2607.08514","last_updated":"2026-07-09T14:09:29Z","snapshot_observed_at":"2026-08-07T11:00:41.421126Z","submitted_at":"2026-07-09T14:09:29Z","title":"Do Egocentric Video-Language Models Capture Both Hand- and Object-Centric Cues?","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-10T06:09:11.411036Z"},"links":{"citing_paper":"/paper/2607.08514"},"observation_digest":"sha256:063882485d9255df2c9a8e57eadb24256a29e6f9e2e35a37e69d750b12781b16","observation_id":"6007da2a-808c-4df5-af2e-84635fdf74d8","resolution":{"observed_at":"2026-07-10T06:16:52.255168Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T06:16:52.225157Z","title":"In: WACV","venue":null,"work_id":"c7b54c18-50e4-4530-b94e-1a12e9c6b26e","year":2025},"citing_paper":{"arxiv_id":"2607.08514","last_updated":"2026-07-09T14:09:29Z","snapshot_observed_at":"2026-08-07T11:00:41.421126Z","submitted_at":"2026-07-09T14:09:29Z","title":"Do Egocentric Video-Language Models Capture Both Hand- and Object-Centric Cues?","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-10T06:09:11.411036Z"},"links":{"citing_paper":"/paper/2607.08514"},"observation_digest":"sha256:fa59c02d4e3043ad53006f3e1d5a661d69151a8e3028359c0ef852c6acd3c4ed","observation_id":"bb01a161-2a0c-40e5-9bcf-e5f73118120f","resolution":{"observed_at":"2026-07-10T06:16:52.226987Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T06:16:52.228397Z","title":"NeurIPS35, 10078–10093 (2022)","venue":null,"work_id":"89466b8e-4c95-48b9-ac64-22b56ad515dc","year":2022},"citing_paper":{"arxiv_id":"2607.08514","last_updated":"2026-07-09T14:09:29Z","snapshot_observed_at":"2026-08-07T11:00:41.421126Z","submitted_at":"2026-07-09T14:09:29Z","title":"Do Egocentric Video-Language Models Capture Both Hand- and Object-Centric Cues?","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-10T06:09:11.411036Z"},"links":{"citing_paper":"/paper/2607.08514"},"observation_digest":"sha256:c4fe05b382d9d9bbc2b2885c3fc649a0ce2a07d122876322b3ff642d2aaaecc7","observation_id":"4b3f941e-bb3f-4be3-a86f-80dc46ed66ae","resolution":{"observed_at":"2026-07-10T06:16:52.230186Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T06:16:52.230909Z","title":"In: Proceedings of the 33rd ACM International Conference on Multimedia","venue":null,"work_id":"4398323d-7908-4148-a36d-be2765a54854","year":2025},"citing_paper":{"arxiv_id":"2607.08514","last_updated":"2026-07-09T14:09:29Z","snapshot_observed_at":"2026-08-07T11:00:41.421126Z","submitted_at":"2026-07-09T14:09:29Z","title":"Do Egocentric Video-Language Models Capture Both Hand- and Object-Centric Cues?","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-10T06:09:11.411036Z"},"links":{"citing_paper":"/paper/2607.08514"},"observation_digest":"sha256:740e26ffd8f5d07a0680c5ad159b2d42403d32b0a02ac466f405430412919461","observation_id":"7a175fb3-91e4-4ad9-9c9b-73e16cd49de9","resolution":{"observed_at":"2026-07-10T06:16:52.239579Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T06:16:52.240992Z","title":"In: CVPR","venue":null,"work_id":"bc0e29b7-ef9e-41a5-8751-e7c5b60fdec5","year":2023},"citing_paper":{"arxiv_id":"2607.08514","last_updated":"2026-07-09T14:09:29Z","snapshot_observed_at":"2026-08-07T11:00:41.421126Z","submitted_at":"2026-07-09T14:09:29Z","title":"Do Egocentric Video-Language Models Capture Both Hand- and Object-Centric Cues?","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-10T06:09:11.411036Z"},"links":{"citing_paper":"/paper/2607.08514"},"observation_digest":"sha256:a7e0c46f50198d2e361306fbf69116c8c36bf275d79f7597ac06c2b2a4e2e17b","observation_id":"3df9347d-d258-4a0c-89d9-e9b9478b357c","resolution":{"observed_at":"2026-07-10T06:16:52.242776Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17719","last_updated":"2025-02-20T04:28:19Z","snapshot_observed_at":"2026-08-06T17:59:06.488128Z","submitted_at":"2024-05-28T00:27:29Z","title":"Do Egocentric Video-Language Models Truly Understand Hand-Object Interactions?","version":3},"cited_work":{"arxiv_id":"2405.17719","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.17719","snapshot_observed_at":"2026-07-10T06:16:51.320014Z","title":"Do egocentric video-language models truly understand hand- object interactions?arXiv preprint arXiv:2405.17719","venue":"cs.CV","work_id":"e8bfd56a-b0e1-4585-b787-c5cd84ba98ac","year":2024},"citing_paper":{"arxiv_id":"2607.08514","last_updated":"2026-07-09T14:09:29Z","snapshot_observed_at":"2026-08-07T11:00:41.421126Z","submitted_at":"2026-07-09T14:09:29Z","title":"Do Egocentric Video-Language Models Capture Both Hand- and Object-Centric Cues?","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-10T06:09:11.411036Z"},"links":{"cited_paper":"/paper/2405.17719","citing_paper":"/paper/2607.08514"},"observation_digest":"sha256:9f5286e3b23db0bced53309bd83cedfac7d6603d90ca3a2440eb726115ecc351","observation_id":"f3de8720-1ab4-461f-bd26-b328d43ff895","resolution":{"observed_at":"2026-07-10T06:16:51.321374Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T06:16:52.261857Z","title":"In: CVPR","venue":null,"work_id":"c39a1001-0148-42fa-9858-a5cd446fde99","year":2024},"citing_paper":{"arxiv_id":"2607.08514","last_updated":"2026-07-09T14:09:29Z","snapshot_observed_at":"2026-08-07T11:00:41.421126Z","submitted_at":"2026-07-09T14:09:29Z","title":"Do Egocentric Video-Language Models Capture Both Hand- and Object-Centric Cues?","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-10T06:09:11.411036Z"},"links":{"citing_paper":"/paper/2607.08514"},"observation_digest":"sha256:ee05cc2767ca898ff5cf6e0a8302736dbf580c6da2a08f45f18527b09a9b760b","observation_id":"f8f705ca-c520-479a-bca8-4ce384ed9f68","resolution":{"observed_at":"2026-07-10T06:16:52.263569Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T06:16:52.265439Z","title":"In: ICCV","venue":null,"work_id":"691496f0-18c0-47c8-bac8-dfb6e83465a1","year":2025},"citing_paper":{"arxiv_id":"2607.08514","last_updated":"2026-07-09T14:09:29Z","snapshot_observed_at":"2026-08-07T11:00:41.421126Z","submitted_at":"2026-07-09T14:09:29Z","title":"Do Egocentric Video-Language Models Capture Both Hand- and Object-Centric Cues?","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-10T06:09:11.411036Z"},"links":{"citing_paper":"/paper/2607.08514"},"observation_digest":"sha256:21b699965d09577ded22a067d909abfbd4ae58ebaba56780c73e8003d5a5ffa0","observation_id":"7b6bc46b-307b-450d-8a29-0a4d34adc9c1","resolution":{"observed_at":"2026-07-10T06:16:52.266755Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T06:16:52.185369Z","title":"In: ICCV","venue":null,"work_id":"21fbe4ae-d373-4961-95a4-17ae7cafec6f","year":2023},"citing_paper":{"arxiv_id":"2607.08514","last_updated":"2026-07-09T14:09:29Z","snapshot_observed_at":"2026-08-07T11:00:41.421126Z","submitted_at":"2026-07-09T14:09:29Z","title":"Do Egocentric Video-Language Models Capture Both Hand- and Object-Centric Cues?","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-10T06:09:11.411036Z"},"links":{"citing_paper":"/paper/2607.08514"},"observation_digest":"sha256:5eb029928253670df1a82a39bc57ed1aa566d0f67a2513075d1fa1c44c5dc774","observation_id":"e2089e88-753a-4a00-a682-2754f0963abf","resolution":{"observed_at":"2026-07-10T06:16:52.187586Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T06:16:52.190770Z","title":"In: CVPR","venue":null,"work_id":"09d2cf0c-ee36-4154-9ced-b792fa681d3c","year":2023},"citing_paper":{"arxiv_id":"2607.08514","last_updated":"2026-07-09T14:09:29Z","snapshot_observed_at":"2026-08-07T11:00:41.421126Z","submitted_at":"2026-07-09T14:09:29Z","title":"Do Egocentric Video-Language Models Capture Both Hand- and Object-Centric Cues?","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-10T06:09:11.411036Z"},"links":{"citing_paper":"/paper/2607.08514"},"observation_digest":"sha256:78df3272e5e95c5a0971991f7d89bf7d40155b6267f649bd3b7fa91871757543","observation_id":"12e412c3-7679-4469-8281-86a7b283436a","resolution":{"observed_at":"2026-07-10T06:16:52.192785Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T06:16:52.174817Z","title":"In: ICCV","venue":null,"work_id":"8be098cd-6f51-41ec-ba27-3b8555e88162","year":2023},"citing_paper":{"arxiv_id":"2607.08514","last_updated":"2026-07-09T14:09:29Z","snapshot_observed_at":"2026-08-07T11:00:41.421126Z","submitted_at":"2026-07-09T14:09:29Z","title":"Do Egocentric Video-Language Models Capture Both Hand- and Object-Centric Cues?","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-10T06:09:11.411036Z"},"links":{"citing_paper":"/paper/2607.08514"},"observation_digest":"sha256:e55e93a5b3ce350c420c6d2833d3b7c0931906e0acb453791c6c265bcfcf7b06","observation_id":"7ddce3c4-ea97-46e9-8a9a-ac2b3c4db958","resolution":{"observed_at":"2026-07-10T06:16:52.176958Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T06:16:52.177869Z","title":"In: Proceedings of the 27th acm international conference on multimedia","venue":null,"work_id":"9433b0f3-c738-44ca-b960-a61e66fbca3d","year":2019},"citing_paper":{"arxiv_id":"2607.08514","last_updated":"2026-07-09T14:09:29Z","snapshot_observed_at":"2026-08-07T11:00:41.421126Z","submitted_at":"2026-07-09T14:09:29Z","title":"Do Egocentric Video-Language Models Capture Both Hand- and Object-Centric Cues?","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-10T06:09:11.411036Z"},"links":{"citing_paper":"/paper/2607.08514"},"observation_digest":"sha256:621c4f3e5499e0aae42a895657157b73645efd5f31065db65a165d01fbc54115","observation_id":"c7980db4-5fe2-4c83-95c7-3e6705b8fdf8","resolution":{"observed_at":"2026-07-10T06:16:52.180471Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2607.08514","last_updated":"2026-07-09T14:09:29Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T11:00:41.421126Z","submitted_at":"2026-07-09T14:09:29Z","title":"Do Egocentric Video-Language Models Capture Both Hand- and Object-Centric Cues?"},"reference_resolution":{"displayed":40,"state_counts":{"malformed_identifier":0,"metadata_mismatch":4,"parse_uncertain":0,"unresolved":0,"verified_exact":1,"verified_fuzzy":35},"total_outbound_references":40},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 40 of 40 outbound references and 0 inbound Pith citation observations for arXiv:2607.08514."}