{"as_of":"2026-08-13T10:40:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6e57da440b2c66677906a73dca32a09c9beae540b12dddb7365fba1f9743514c","coverage":[{"denominator":97,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":97,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T23:07:14.748483Z","state":"measured"},{"denominator":104,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":104,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":7,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":7,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:39:37.248378Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T16:39:57.306268Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.21080","last_updated":"2024-12-30T16:57:05Z","snapshot_observed_at":"2026-08-12T17:46:33.884595Z","submitted_at":"2024-12-30T16:57:05Z","title":"Vinci: A Real-time Embodied Smart Assistant based on Egocentric Vision-Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.21080","snapshot_observed_at":"2026-08-07T15:39:37.248378Z","title":"Vinci: A real-time embodied smart assistant based on egocentric vision-language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14346","last_updated":"2025-07-26T23:19:43Z","snapshot_observed_at":"2026-08-11T06:50:38.400409Z","submitted_at":"2025-05-20T13:29:33Z","title":"Egocentric Action-aware Inertial Localization in Point Clouds with Vision-Language Guidance","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T15:39:37.248378Z"},"links":{"cited_paper":"/paper/2412.21080","citing_paper":"/paper/2505.14346"},"observation_digest":"sha256:f1a332b0b41f1d78d1694e1e6eea7eb0b926fc2958164b4a55aad8248a7b7f32","observation_id":"72f24855-0ec1-4f79-87f8-ae86f6cb6ffc","resolution":{"observed_at":"2026-08-07T15:39:37.248378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.21080","last_updated":"2024-12-30T16:57:05Z","snapshot_observed_at":"2026-08-12T17:46:33.884595Z","submitted_at":"2024-12-30T16:57:05Z","title":"Vinci: A Real-time Embodied Smart Assistant based on Egocentric Vision-Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.21080","snapshot_observed_at":"2026-08-07T10:29:07.228004Z","title":"Vinci: A real-time embodied smart assistant based on egocentric vision-language model.arXiv preprint arXiv:2412.21080, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05287","last_updated":"2025-06-05T17:44:12Z","snapshot_observed_at":"2026-08-12T14:24:44.641325Z","submitted_at":"2025-06-05T17:44:12Z","title":"EOC-Bench: Can MLLMs Identify, Recall, and Forecast Objects in an Egocentric World?","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T10:29:07.228004Z"},"links":{"cited_paper":"/paper/2412.21080","citing_paper":"/paper/2506.05287"},"observation_digest":"sha256:b3bd697ef4d1880a8bfd3120c95bc8a9d83c8fd0a166f1847eb41be3d34a1f76","observation_id":"b8e01093-7009-49ed-a8c0-4e8fe09081b2","resolution":{"observed_at":"2026-08-07T10:29:07.228004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.21080","last_updated":"2024-12-30T16:57:05Z","snapshot_observed_at":"2026-08-12T17:46:33.884595Z","submitted_at":"2024-12-30T16:57:05Z","title":"Vinci: A Real-time Embodied Smart Assistant based on Egocentric Vision-Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.21080","snapshot_observed_at":"2026-08-07T06:00:58.390895Z","title":"Vinci: A real-time embodied smart assistant based on egocentric vision-language model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06253","last_updated":"2025-06-06T17:25:48Z","snapshot_observed_at":"2026-08-09T07:19:17.693738Z","submitted_at":"2025-06-06T17:25:48Z","title":"Bridging Perspectives: A Survey on Cross-view Collaborative Intelligence with Egocentric-Exocentric Vision","version":1},"reference_index":136,"source":"pdf_text","source_observed_at":"2026-08-07T06:00:58.390895Z"},"links":{"cited_paper":"/paper/2412.21080","citing_paper":"/paper/2506.06253"},"observation_digest":"sha256:a325eb7ec477497eabb9b7f08d082c2841cbf84979e3f445d3015339a59ed1f7","observation_id":"c9468671-ac66-4673-a0f2-5a325648989c","resolution":{"observed_at":"2026-08-07T06:00:58.390895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.21080","last_updated":"2024-12-30T16:57:05Z","snapshot_observed_at":"2026-08-12T17:46:33.884595Z","submitted_at":"2024-12-30T16:57:05Z","title":"Vinci: A Real-time Embodied Smart Assistant based on Egocentric Vision-Language Model","version":1},"cited_work":{"arxiv_id":"2412.21080","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.21080","snapshot_observed_at":"2026-07-04T16:39:57.306268Z","title":"Huang, J","venue":null,"work_id":"44821091-236f-4ee5-a620-01fb17c48c5f","year":2024},"citing_paper":{"arxiv_id":"2601.17622","last_updated":"2026-05-06T21:23:50Z","snapshot_observed_at":"2026-08-11T13:48:22.156066Z","submitted_at":"2026-01-24T22:56:50Z","title":"Memento: Towards Proactive Visualization of Everyday Memories with Personal Wearable AR Assistant","version":4},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-16T10:49:25.312165Z"},"links":{"cited_paper":"/paper/2412.21080","citing_paper":"/paper/2601.17622"},"observation_digest":"sha256:29d8d024f458f97fc5de222691812167ca8f7fc730bef0a0f10c04600baf8b66","observation_id":"ceef77ff-df8a-4e65-a6c3-7beb71ea261f","resolution":{"observed_at":"2026-05-16T10:50:51.441624Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.21080","last_updated":"2024-12-30T16:57:05Z","snapshot_observed_at":"2026-08-12T17:46:33.884595Z","submitted_at":"2024-12-30T16:57:05Z","title":"Vinci: A Real-time Embodied Smart Assistant based on Egocentric Vision-Language Model","version":1},"cited_work":{"arxiv_id":"2412.21080","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.21080","snapshot_observed_at":"2026-07-04T16:39:57.306268Z","title":"Huang, J","venue":null,"work_id":"44821091-236f-4ee5-a620-01fb17c48c5f","year":2024},"citing_paper":{"arxiv_id":"2604.12081","last_updated":"2026-04-13T21:42:40Z","snapshot_observed_at":"2026-08-11T12:52:25.246545Z","submitted_at":"2026-04-13T21:42:40Z","title":"Human-Inspired Context-Selective Multimodal Memory for Social Robots","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-10T15:37:56.427507Z"},"links":{"cited_paper":"/paper/2412.21080","citing_paper":"/paper/2604.12081"},"observation_digest":"sha256:86c1bc9e8846ce2a01306814d56a7af12903e3c8305746d712dbf0f097acb194","observation_id":"cbd04bbf-28cc-484d-875c-2bd4d4a42efa","resolution":{"observed_at":"2026-05-11T10:06:05.820629Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.21080","last_updated":"2024-12-30T16:57:05Z","snapshot_observed_at":"2026-08-12T17:46:33.884595Z","submitted_at":"2024-12-30T16:57:05Z","title":"Vinci: A Real-time Embodied Smart Assistant based on Egocentric Vision-Language Model","version":1},"cited_work":{"arxiv_id":"2412.21080","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.21080","snapshot_observed_at":"2026-07-04T16:39:57.306268Z","title":"Huang, J","venue":null,"work_id":"44821091-236f-4ee5-a620-01fb17c48c5f","year":2024},"citing_paper":{"arxiv_id":"2606.24422","last_updated":"2026-06-23T10:59:25Z","snapshot_observed_at":"2026-08-12T17:53:51.025868Z","submitted_at":"2026-06-23T10:59:25Z","title":"EgoSAT: A Comprehensive Benchmark of Egocentric Streaming Interaction Understanding","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-26T00:26:33.306128Z"},"links":{"cited_paper":"/paper/2412.21080","citing_paper":"/paper/2606.24422"},"observation_digest":"sha256:cd0e56bc70c1d3f3009a6afe75f68faad941d84126a61b83ec43d80a86887fc7","observation_id":"38d7a5d8-2702-45b7-a673-c5a029976b33","resolution":{"observed_at":"2026-07-04T16:39:57.307729Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.21080","last_updated":"2024-12-30T16:57:05Z","snapshot_observed_at":"2026-08-12T17:46:33.884595Z","submitted_at":"2024-12-30T16:57:05Z","title":"Vinci: A Real-time Embodied Smart Assistant based on Egocentric Vision-Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.21080","snapshot_observed_at":"2026-07-14T05:01:06.200663Z","title":"arXiv preprint arXiv:2412.21080 (2024) 2, 4","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.11523","last_updated":"2026-07-13T13:09:45Z","snapshot_observed_at":"2026-08-12T23:43:14.276055Z","submitted_at":"2026-07-13T13:09:45Z","title":"Vinci2: Providing Proactive Assistance in Continuous Egocentric Videos","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-14T05:01:06.200663Z"},"links":{"cited_paper":"/paper/2412.21080","citing_paper":"/paper/2607.11523"},"observation_digest":"sha256:300f7e1549f95d46682c3502e41630a0dc1d9c3a8218fa17759d5280e5e9edfb","observation_id":"8a64f381-c73e-49db-903b-8d37a2beb353","resolution":{"observed_at":"2026-07-14T05:01:06.200663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2412.21080/citation-record","integrity":"/paper/2412.21080/integrity","json":"/paper/2412.21080/citation-record.json","paper":"/paper/2412.21080"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-10T23:07:14.331971Z","title":"Dai, Anja Hauth, Katie Millican, David Silver, Slav Petrov, Melvin Johnson, Ioannis Antonoglou, Julian Schrit- twieser, Amelia Glaese, Jilin Chen, Emily Pitler, Timothy P","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.21080","last_updated":"2024-12-30T16:57:05Z","snapshot_observed_at":"2026-08-12T17:46:33.884595Z","submitted_at":"2024-12-30T16:57:05Z","title":"Vinci: A Real-time Embodied Smart Assistant based on Egocentric Vision-Language Model","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:14.331971Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2412.21080"},"observation_digest":"sha256:66298eeb443ced03eec24ffc39de2b90e2c52c948426bab60dcd240a68a9f9cf","observation_id":"bd6ddc5a-13a4-4b4a-ab2c-4f79252f26e1","resolution":{"observed_at":"2026-08-10T23:07:14.331971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:07:14.337134Z","title":"Swim- master: a wearable assistant for swimmer","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2412.21080","last_updated":"2024-12-30T16:57:05Z","snapshot_observed_at":"2026-08-12T17:46:33.884595Z","submitted_at":"2024-12-30T16:57:05Z","title":"Vinci: A Real-time Embodied Smart Assistant based on Egocentric Vision-Language Model","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:14.337134Z"},"links":{"citing_paper":"/paper/2412.21080"},"observation_digest":"sha256:dcc0ee0e4d3db996e6b8eb6404ea57b2bc8b7f3d54d852298c933b41c3b5983c","observation_id":"cfcf406a-9ecc-4c4b-b4b3-162a9bb23f32","resolution":{"observed_at":"2026-08-10T23:07:14.337134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-10T23:07:14.341548Z","title":"Qwen-vl: A versatile vision-language model for understand- ing, localization, text reading, and beyond","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.21080","last_updated":"2024-12-30T16:57:05Z","snapshot_observed_at":"2026-08-12T17:46:33.884595Z","submitted_at":"2024-12-30T16:57:05Z","title":"Vinci: A Real-time Embodied Smart Assistant based on Egocentric Vision-Language Model","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:14.341548Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2412.21080"},"observation_digest":"sha256:1f70b90c2ca86c843152f96bc215a1fcc63f790781f62ddee727d25c273d7ee4","observation_id":"fa0e6e6d-4753-4892-bef7-46e60c23a757","resolution":{"observed_at":"2026-08-10T23:07:14.341548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:07:14.346187Z","title":"Analysis of the hands in egocentric vision: A survey","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.21080","last_updated":"2024-12-30T16:57:05Z","snapshot_observed_at":"2026-08-12T17:46:33.884595Z","submitted_at":"2024-12-30T16:57:05Z","title":"Vinci: A Real-time Embodied Smart Assistant based on Egocentric Vision-Language Model","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:14.346187Z"},"links":{"citing_paper":"/paper/2412.21080"},"observation_digest":"sha256:b47a84843938028b544049d6a6dcd42097d21018f210255f9d0f481590939ff9","observation_id":"d301eb7f-de99-49f7-8b55-c29500649ccf","resolution":{"observed_at":"2026-08-10T23:07:14.346187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:07:14.350491Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.21080","last_updated":"2024-12-30T16:57:05Z","snapshot_observed_at":"2026-08-12T17:46:33.884595Z","submitted_at":"2024-12-30T16:57:05Z","title":"Vinci: A Real-time Embodied Smart Assistant based on Egocentric Vision-Language Model","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:14.350491Z"},"links":{"citing_paper":"/paper/2412.21080"},"observation_digest":"sha256:b6061d625de5e2118307ea553dbaccef9b7ed7c7a96227918fddc81ac02a5d13","observation_id":"9fe67223-53fb-4d19-a7d8-973674cb4640","resolution":{"observed_at":"2026-08-10T23:07:14.350491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:07:14.354875Z","title":"Internlm2 technical report, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.21080","last_updated":"2024-12-30T16:57:05Z","snapshot_observed_at":"2026-08-12T17:46:33.884595Z","submitted_at":"2024-12-30T16:57:05Z","title":"Vinci: A Real-time Embodied Smart Assistant based on Egocentric Vision-Language Model","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:14.354875Z"},"links":{"citing_paper":"/paper/2412.21080"},"observation_digest":"sha256:f34f27e0bb9972f3ef92a7aaca64f0842127184a6c9e274588bfaf5eb533ebe2","observation_id":"8455371b-fdc7-433d-915e-7ec5c1a59c15","resolution":{"observed_at":"2026-08-10T23:07:14.354875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09529","last_updated":"2022-11-17T13:45:06Z","snapshot_observed_at":"2026-08-10T05:30:20.599642Z","submitted_at":"2022-11-17T13:45:06Z","title":"InternVideo-Ego4D: A Pack of Champion Solutions to Ego4D Challenges","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09529","snapshot_observed_at":"2026-08-10T23:07:14.359740Z","title":"Internvideo-ego4d: A pack of champion solu- tions to ego4d challenges","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.21080","last_updated":"2024-12-30T16:57:05Z","snapshot_observed_at":"2026-08-12T17:46:33.884595Z","submitted_at":"2024-12-30T16:57:05Z","title":"Vinci: A Real-time Embodied Smart Assistant based on Egocentric Vision-Language Model","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:14.359740Z"},"links":{"cited_paper":"/paper/2211.09529","citing_paper":"/paper/2412.21080"},"observation_digest":"sha256:9b93bbd1141ed28b7853cbc7c9f7328ce8f62f3d5e910253ad233c2ae6bc860e","observation_id":"6f2717d3-f7b1-46d3-8f65-7ff8d8ec4e97","resolution":{"observed_at":"2026-08-10T23:07:14.359740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:07:14.364280Z","title":"Dcan: improving temporal action detection via dual context aggregation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.21080","last_updated":"2024-12-30T16:57:05Z","snapshot_observed_at":"2026-08-12T17:46:33.884595Z","submitted_at":"2024-12-30T16:57:05Z","title":"Vinci: A Real-time Embodied Smart Assistant based on Egocentric Vision-Language Model","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:14.364280Z"},"links":{"citing_paper":"/paper/2412.21080"},"observation_digest":"sha256:77a66ea157b0d7369d3b74721a5edcd793eec3dfdc803d04bb6a622ad0b9303c","observation_id":"d80c5428-67c9-4371-9864-88b495c6c5d9","resolution":{"observed_at":"2026-08-10T23:07:14.364280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:07:14.368251Z","title":"Elan: Enhancing temporal action detection with location awareness","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.21080","last_updated":"2024-12-30T16:57:05Z","snapshot_observed_at":"2026-08-12T17:46:33.884595Z","submitted_at":"2024-12-30T16:57:05Z","title":"Vinci: A Real-time Embodied Smart Assistant based on Egocentric Vision-Language Model","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:14.368251Z"},"links":{"citing_paper":"/paper/2412.21080"},"observation_digest":"sha256:83018c69c603e5fb6ddfa81349098bd5b0787165f321bdf8ed894427921100d9","observation_id":"d5eb3f21-fe80-4eee-9c0d-550b576a4a92","resolution":{"observed_at":"2026-08-10T23:07:14.368251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13292","last_updated":"2023-05-23T07:48:15Z","snapshot_observed_at":"2026-08-11T01:34:05.694973Z","submitted_at":"2023-05-22T17:51:22Z","title":"VideoLLM: Modeling Video Sequence with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13292","snapshot_observed_at":"2026-08-10T23:07:14.372376Z","title":"Videollm: Modeling video sequence with large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.21080","last_updated":"2024-12-30T16:57:05Z","snapshot_observed_at":"2026-08-12T17:46:33.884595Z","submitted_at":"2024-12-30T16:57:05Z","title":"Vinci: A Real-time Embodied Smart Assistant based on Egocentric Vision-Language Model","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:14.372376Z"},"links":{"cited_paper":"/paper/2305.13292","citing_paper":"/paper/2412.21080"},"observation_digest":"sha256:bcfca418846ddaf94ea3872bc639b5432950418995d97b7d77d792052cb509ad","observation_id":"bbaa22a6-33f3-40a5-a81b-6b74f22d5da3","resolution":{"observed_at":"2026-08-10T23:07:14.372376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09626","last_updated":"2024-03-14T17:57:07Z","snapshot_observed_at":"2026-08-13T00:54:03.001987Z","submitted_at":"2024-03-14T17:57:07Z","title":"Video Mamba Suite: State Space Model as a Versatile Alternative for Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09626","snapshot_observed_at":"2026-08-10T23:07:14.376930Z","title":"Video mamba suite: State space model as a ver- satile alternative for video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.21080","last_updated":"2024-12-30T16:57:05Z","snapshot_observed_at":"2026-08-12T17:46:33.884595Z","submitted_at":"2024-12-30T16:57:05Z","title":"Vinci: A Real-time Embodied Smart Assistant based on Egocentric Vision-Language Model","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:14.376930Z"},"links":{"cited_paper":"/paper/2403.09626","citing_paper":"/paper/2412.21080"},"observation_digest":"sha256:56145dd7304be43f23cc6a73650b26d7245ab5bda8f70ee3265cdd3c6312b613","observation_id":"cac52273-6630-49e3-be8e-ddcac21a80af","resolution":{"observed_at":"2026-08-10T23:07:14.376930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.12075","last_updated":"2024-12-16T18:46:45Z","snapshot_observed_at":"2026-08-13T05:16:24.913588Z","submitted_at":"2024-12-16T18:46:45Z","title":"CG-Bench: Clue-grounded Question Answering Benchmark for Long Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.12075","snapshot_observed_at":"2026-08-10T23:07:14.381559Z","title":"Cg-bench: Clue-grounded question answering benchmark for long video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.21080","last_updated":"2024-12-30T16:57:05Z","snapshot_observed_at":"2026-08-12T17:46:33.884595Z","submitted_at":"2024-12-30T16:57:05Z","title":"Vinci: A Real-time Embodied Smart Assistant based on Egocentric Vision-Language Model","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:14.381559Z"},"links":{"cited_paper":"/paper/2412.12075","citing_paper":"/paper/2412.21080"},"observation_digest":"sha256:7d31a8b6aa98c6d2436cf403277f0b3fa105ec8b3ad16fbc8834cc88ccdec3e3","observation_id":"c6578085-a73b-4727-b924-867d9c0aec1c","resolution":{"observed_at":"2026-08-10T23:07:14.381559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:07:14.385876Z","title":"Gatehub: Gated history unit with background suppression for online action detection","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.21080","last_updated":"2024-12-30T16:57:05Z","snapshot_observed_at":"2026-08-12T17:46:33.884595Z","submitted_at":"2024-12-30T16:57:05Z","title":"Vinci: A Real-time Embodied Smart Assistant based on Egocentric Vision-Language Model","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:14.385876Z"},"links":{"citing_paper":"/paper/2412.21080"},"observation_digest":"sha256:bcf30c3c386271ee524a33c2057d03e2bccbc762922b9b6d13d0156d99cb032c","observation_id":"dc325425-3ef9-43cf-bd16-228429bf1ae4","resolution":{"observed_at":"2026-08-10T23:07:14.385876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:07:14.389760Z","title":"Videollm-online: Online video large language model for streaming video","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.21080","last_updated":"2024-12-30T16:57:05Z","snapshot_observed_at":"2026-08-12T17:46:33.884595Z","submitted_at":"2024-12-30T16:57:05Z","title":"Vinci: A Real-time Embodied Smart Assistant based on Egocentric Vision-Language Model","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:14.389760Z"},"links":{"citing_paper":"/paper/2412.21080"},"observation_digest":"sha256:95af2c894639efe8793abeec61b83d57bf3cf760638b26ba02651c62b9c08f3a","observation_id":"966d4664-06ae-4ffa-bcc8-e76b8ceae919","resolution":{"observed_at":"2026-08-10T23:07:14.389760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:07:14.393831Z","title":"Seine: Short-to-long video diffusion model for generative transition and prediction","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.21080","last_updated":"2024-12-30T16:57:05Z","snapshot_observed_at":"2026-08-12T17:46:33.884595Z","submitted_at":"2024-12-30T16:57:05Z","title":"Vinci: A Real-time Embodied Smart Assistant based on Egocentric Vision-Language Model","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:14.393831Z"},"links":{"citing_paper":"/paper/2412.21080"},"observation_digest":"sha256:224863547e6a663593ea3f17d20f35bc09cf15bb6496a9935a19b4f2f41fca6d","observation_id":"647ee9ad-6757-45c9-95c8-dbc54f48f491","resolution":{"observed_at":"2026-08-10T23:07:14.393831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:07:14.397896Z","title":"gSDF: Geometry-Driven signed distance functions for 3D hand-object reconstruction","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.21080","last_updated":"2024-12-30T16:57:05Z","snapshot_observed_at":"2026-08-12T17:46:33.884595Z","submitted_at":"2024-12-30T16:57:05Z","title":"Vinci: A Real-time Embodied Smart Assistant based on Egocentric Vision-Language Model","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:14.397896Z"},"links":{"citing_paper":"/paper/2412.21080"},"observation_digest":"sha256:3b3820baf22c5dd9eb56f167944231b1401356d98af369c3cd05d40bb19a272c","observation_id":"f4e0bdab-c45e-44c5-a275-d2b9e7c40fe5","resolution":{"observed_at":"2026-08-10T23:07:14.397896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-10T23:07:14.402030Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test- time scaling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.21080","last_updated":"2024-12-30T16:57:05Z","snapshot_observed_at":"2026-08-12T17:46:33.884595Z","submitted_at":"2024-12-30T16:57:05Z","title":"Vinci: A Real-time Embodied Smart Assistant based on Egocentric Vision-Language Model","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:14.402030Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2412.21080"},"observation_digest":"sha256:f9986008ef4fbc7c775d67d9809614d94fdb744c5881d958d5f84bd9529f35c8","observation_id":"4a4005a2-c553-4284-93bf-4d199e027499","resolution":{"observed_at":"2026-08-10T23:07:14.402030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:07:14.406367Z","title":"Intern vl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.21080","last_updated":"2024-12-30T16:57:05Z","snapshot_observed_at":"2026-08-12T17:46:33.884595Z","submitted_at":"2024-12-30T16:57:05Z","title":"Vinci: A Real-time Embodied Smart Assistant based on Egocentric Vision-Language Model","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:14.406367Z"},"links":{"citing_paper":"/paper/2412.21080"},"observation_digest":"sha256:47504d9a3f059a27d82b0f91d53ccd68c99aa46b4703e0bd6f806a40dbdf5bb8","observation_id":"32aca28f-97e8-4598-b5e7-61f0a41f8529","resolution":{"observed_at":"2026-08-10T23:07:14.406367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:07:14.410760Z","title":"Scaling egocentric vision: The epic-kitchens dataset","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.21080","last_updated":"2024-12-30T16:57:05Z","snapshot_observed_at":"2026-08-12T17:46:33.884595Z","submitted_at":"2024-12-30T16:57:05Z","title":"Vinci: A Real-time Embodied Smart Assistant based on Egocentric Vision-Language Model","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:14.410760Z"},"links":{"citing_paper":"/paper/2412.21080"},"observation_digest":"sha256:a80fbecf33fa250ecfb9e0e9e273d108f6e8d61b076b7d76f4392ed7ca3d0e02","observation_id":"20985824-880b-43c4-9a11-69fe87a6f4e5","resolution":{"observed_at":"2026-08-10T23:07:14.410760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:07:14.415273Z","title":"Rescaling egocentric vision: Collection, pipeline and challenges for epic-kitchens-100","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.21080","last_updated":"2024-12-30T16:57:05Z","snapshot_observed_at":"2026-08-12T17:46:33.884595Z","submitted_at":"2024-12-30T16:57:05Z","title":"Vinci: A Real-time Embodied Smart Assistant based on Egocentric Vision-Language Model","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:14.415273Z"},"links":{"citing_paper":"/paper/2412.21080"},"observation_digest":"sha256:8cdf25fac8efcf894eddb5a647feb85b5fc55ee8aa47a9c8dcdbde241c5d2b15","observation_id":"cb665245-fe7b-4fe7-8099-28367790350a","resolution":{"observed_at":"2026-08-10T23:07:14.415273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:07:14.420252Z","title":"Wearable reasoner: towards enhanced human rational- ity through a wearable device with an explainable ai assistant","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.21080","last_updated":"2024-12-30T16:57:05Z","snapshot_observed_at":"2026-08-12T17:46:33.884595Z","submitted_at":"2024-12-30T16:57:05Z","title":"Vinci: A Real-time Embodied Smart Assistant based on Egocentric Vision-Language Model","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:14.420252Z"},"links":{"citing_paper":"/paper/2412.21080"},"observation_digest":"sha256:5b107ccb34ce7e2e33e488ccfbba3e4c76ab0937410063e1cf373af2b465646a","observation_id":"637ce2fc-f4db-4fe4-b052-248e35cac2f5","resolution":{"observed_at":"2026-08-10T23:07:14.420252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:07:14.424394Z","title":"Summarization of egocentric videos: A com- prehensive survey","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.21080","last_updated":"2024-12-30T16:57:05Z","snapshot_observed_at":"2026-08-12T17:46:33.884595Z","submitted_at":"2024-12-30T16:57:05Z","title":"Vinci: A Real-time Embodied Smart Assistant based on Egocentric Vision-Language Model","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:14.424394Z"},"links":{"citing_paper":"/paper/2412.21080"},"observation_digest":"sha256:98156df0968c5e7e27b84b433dcb9f000382af4862407670421357c4e5e68281","observation_id":"07606b05-82c5-4b80-9ec1-0f787131951e","resolution":{"observed_at":"2026-08-10T23:07:14.424394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03567","last_updated":"2024-08-07T06:10:45Z","snapshot_observed_at":"2026-08-12T23:07:28.020089Z","submitted_at":"2024-08-07T06:10:45Z","title":"Unlocking Exocentric Video-Language Data for Egocentric Video Representation Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03567","snapshot_observed_at":"2026-08-10T23:07:14.428452Z","title":"Un- locking exocentric video-language data for egocentric video representation learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.21080","last_updated":"2024-12-30T16:57:05Z","snapshot_observed_at":"2026-08-12T17:46:33.884595Z","submitted_at":"2024-12-30T16:57:05Z","title":"Vinci: A Real-time Embodied Smart Assistant based on Egocentric Vision-Language Model","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:14.428452Z"},"links":{"cited_paper":"/paper/2408.03567","citing_paper":"/paper/2412.21080"},"observation_digest":"sha256:699f34c3bd10f92c23ba90b0549d6862fcb0b96b12c10f75c5dc454a73bffd4d","observation_id":"07b030a9-e035-4a6e-85e2-8c3ec4ba9eee","resolution":{"observed_at":"2026-08-10T23:07:14.428452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:07:14.433221Z","title":"Learning to recognize objects in egocentric activities","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2412.21080","last_updated":"2024-12-30T16:57:05Z","snapshot_observed_at":"2026-08-12T17:46:33.884595Z","submitted_at":"2024-12-30T16:57:05Z","title":"Vinci: A Real-time Embodied Smart Assistant based on Egocentric Vision-Language Model","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:14.433221Z"},"links":{"citing_paper":"/paper/2412.21080"},"observation_digest":"sha256:52ac3cc2fd6a6f0d676d15d541ddbe7cee473b543d1533fe2bd779f778fcb09d","observation_id":"578d1f27-e4aa-4a22-a3ec-4589f6a157d3","resolution":{"observed_at":"2026-08-10T23:07:14.433221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:07:14.438325Z","title":"What would you expect? anticipating egocentric actions with rolling-unrolling lstms and modality attention","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.21080","last_updated":"2024-12-30T16:57:05Z","snapshot_observed_at":"2026-08-12T17:46:33.884595Z","submitted_at":"2024-12-30T16:57:05Z","title":"Vinci: A Real-time Embodied Smart Assistant based on Egocentric Vision-Language Model","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:14.438325Z"},"links":{"citing_paper":"/paper/2412.21080"},"observation_digest":"sha256:25a1f8758e7598c30618d989272983bff8b671d868090b19938b78e31a9b09f7","observation_id":"a5e069c1-68bd-4df0-9b8a-1e6ff126d489","resolution":{"observed_at":"2026-08-10T23:07:14.438325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:07:15.840083Z","title":"What would you expect? anticipating egocentric actions with rolling- unrolling lstms and modality attention","venue":null,"work_id":"dd696653-f33e-4564-9b39-184a7dc22365","year":null},"citing_paper":{"arxiv_id":"2412.21080","last_updated":"2024-12-30T16:57:05Z","snapshot_observed_at":"2026-08-12T17:46:33.884595Z","submitted_at":"2024-12-30T16:57:05Z","title":"Vinci: A Real-time Embodied Smart Assistant based on Egocentric Vision-Language Model","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:14.442431Z"},"links":{"citing_paper":"/paper/2412.21080"},"observation_digest":"sha256:5b0b56e31e67f2a7b93740d1e15114863c5648258fa50989bb94c3e88e7608ef","observation_id":"f462ad46-9f37-4d30-a231-4daebe4d2813","resolution":{"observed_at":"2026-08-10T23:07:15.845089Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:07:15.826648Z","title":"Unsupervised video summarization via relation- aware assignment learning","venue":null,"work_id":"5b2a206d-c85b-4b2f-b596-c10648fc03a0","year":2020},"citing_paper":{"arxiv_id":"2412.21080","last_updated":"2024-12-30T16:57:05Z","snapshot_observed_at":"2026-08-12T17:46:33.884595Z","submitted_at":"2024-12-30T16:57:05Z","title":"Vinci: A Real-time Embodied Smart Assistant based on Egocentric Vision-Language Model","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:14.446939Z"},"links":{"citing_paper":"/paper/2412.21080"},"observation_digest":"sha256:c693c1f531e10e964c292076390366326dab37b9ff1ae4fde6b58859d4b839b4","observation_id":"89edebc3-d597-43e0-aebc-d6e2b6e32a72","resolution":{"observed_at":"2026-08-10T23:07:15.831336Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:07:15.813378Z","title":"Weakly-supervised action segmentation and unseen error detection in anomalous instructional videos","venue":null,"work_id":"e09d7588-6ad0-447c-97a1-82cd33c09527","year":2023},"citing_paper":{"arxiv_id":"2412.21080","last_updated":"2024-12-30T16:57:05Z","snapshot_observed_at":"2026-08-12T17:46:33.884595Z","submitted_at":"2024-12-30T16:57:05Z","title":"Vinci: A Real-time Embodied Smart Assistant based on Egocentric Vision-Language Model","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:14.451258Z"},"links":{"citing_paper":"/paper/2412.21080"},"observation_digest":"sha256:dec49e80bf721f559e41ce548c75a2b7833f87946d2d08c525b801b41a32daf7","observation_id":"40f8dee7-3026-4cc8-9e26-4bc195da9efb","resolution":{"observed_at":"2026-08-10T23:07:15.817776Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:07:15.799795Z","title":"Ego4d: Around the World in 3,000 Hours of Egocentric Video","venue":null,"work_id":"291b7e95-f01f-4509-8ec3-a0822820948f","year":2022},"citing_paper":{"arxiv_id":"2412.21080","last_updated":"2024-12-30T16:57:05Z","snapshot_observed_at":"2026-08-12T17:46:33.884595Z","submitted_at":"2024-12-30T16:57:05Z","title":"Vinci: A Real-time Embodied Smart Assistant based on Egocentric Vision-Language Model","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:14.456268Z"},"links":{"citing_paper":"/paper/2412.21080"},"observation_digest":"sha256:ce22ca4143795a5aead43c3e36cd050124500c8e287b97a02f814643cd968721","observation_id":"3a10ba8a-273e-4a78-b4f4-5f6d5393a6c9","resolution":{"observed_at":"2026-08-10T23:07:15.804685Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.18259","last_updated":"2024-09-25T21:55:38Z","snapshot_observed_at":"2026-08-13T05:13:48.123305Z","submitted_at":"2023-11-30T05:21:07Z","title":"Ego-Exo4D: Understanding Skilled Human Activity from First- and Third-Person Perspectives","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.18259","snapshot_observed_at":"2026-08-10T23:07:14.460542Z","title":"Ego-exo4d: Un- derstanding skilled human activity from first-and third-person perspectives","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.21080","last_updated":"2024-12-30T16:57:05Z","snapshot_observed_at":"2026-08-12T17:46:33.884595Z","submitted_at":"2024-12-30T16:57:05Z","title":"Vinci: A Real-time Embodied Smart Assistant based on Egocentric Vision-Language Model","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:14.460542Z"},"links":{"cited_paper":"/paper/2311.18259","citing_paper":"/paper/2412.21080"},"observation_digest":"sha256:90c0b3bb26db6569aa067e14b13a8ecdab09271d1409672f7b31473d660e7424","observation_id":"9710b1ce-8982-4893-abfb-0f3e58fa7d4f","resolution":{"observed_at":"2026-08-10T23:07:14.460542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:07:15.786520Z","title":null,"venue":null,"work_id":"37a9d88e-cdac-4c3e-97f1-49023d6f43cc","year":null},"citing_paper":{"arxiv_id":"2412.21080","last_updated":"2024-12-30T16:57:05Z","snapshot_observed_at":"2026-08-12T17:46:33.884595Z","submitted_at":"2024-12-30T16:57:05Z","title":"Vinci: A Real-time Embodied Smart Assistant based on Egocentric Vision-Language Model","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:14.465095Z"},"links":{"citing_paper":"/paper/2412.21080"},"observation_digest":"sha256:7ad724561db70df6d6d052df584572efefb571ccdd53e98271d6fb48ae57b234","observation_id":"04aaf6b1-9e8b-47a9-aef3-457d7cc7bc63","resolution":{"observed_at":"2026-08-10T23:07:15.791032Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:07:15.773431Z","title":"Pre- dicting gaze in egocentric video by learning task-dependent attention transition","venue":null,"work_id":"aaf499ba-5188-450a-8837-a0e74e1f197e","year":2018},"citing_paper":{"arxiv_id":"2412.21080","last_updated":"2024-12-30T16:57:05Z","snapshot_observed_at":"2026-08-12T17:46:33.884595Z","submitted_at":"2024-12-30T16:57:05Z","title":"Vinci: A Real-time Embodied Smart Assistant based on Egocentric Vision-Language Model","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:14.469409Z"},"links":{"citing_paper":"/paper/2412.21080"},"observation_digest":"sha256:61afa05e084a785d8b8ae4f52f5aebb354684a79f02a082e60130727491ca34d","observation_id":"5f98856a-bfa2-4c60-aa2e-3370688c9bb9","resolution":{"observed_at":"2026-08-10T23:07:15.777844Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:07:15.760321Z","title":"Mutual context network for jointly estimating egocentric gaze and action","venue":null,"work_id":"79b31bfc-8f7f-4593-a8b7-ec9173c072d0","year":2020},"citing_paper":{"arxiv_id":"2412.21080","last_updated":"2024-12-30T16:57:05Z","snapshot_observed_at":"2026-08-12T17:46:33.884595Z","submitted_at":"2024-12-30T16:57:05Z","title":"Vinci: A Real-time Embodied Smart Assistant based on Egocentric Vision-Language Model","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:14.473685Z"},"links":{"citing_paper":"/paper/2412.21080"},"observation_digest":"sha256:fbf2b4fe9010f6020899e0863c43e698f6f12292cafddef746b49bdc3b27f93b","observation_id":"a32170cf-d6d8-4c90-a14e-28271db4de5b","resolution":{"observed_at":"2026-08-10T23:07:15.764659Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:07:15.746722Z","title":"Improving action segmentation via graph-based temporal reasoning","venue":null,"work_id":"a78483f7-afba-4c94-a251-c82e349ccea0","year":2020},"citing_paper":{"arxiv_id":"2412.21080","last_updated":"2024-12-30T16:57:05Z","snapshot_observed_at":"2026-08-12T17:46:33.884595Z","submitted_at":"2024-12-30T16:57:05Z","title":"Vinci: A Real-time Embodied Smart Assistant based on Egocentric Vision-Language Model","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:14.477883Z"},"links":{"citing_paper":"/paper/2412.21080"},"observation_digest":"sha256:2c4867f6dd9b37e8b159aa240cdf1dbb3ae3823dc6b7cc8bb295ded4b550ac29","observation_id":"cb7f878e-9aff-409b-a534-9e67225431f0","resolution":{"observed_at":"2026-08-10T23:07:15.751203Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:07:15.733397Z","title":"Compound proto- type matching for few-shot action recognition","venue":null,"work_id":"162c316f-d590-4cd1-9aa8-203f61e2c79f","year":null},"citing_paper":{"arxiv_id":"2412.21080","last_updated":"2024-12-30T16:57:05Z","snapshot_observed_at":"2026-08-12T17:46:33.884595Z","submitted_at":"2024-12-30T16:57:05Z","title":"Vinci: A Real-time Embodied Smart Assistant based on Egocentric Vision-Language Model","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:14.482706Z"},"links":{"citing_paper":"/paper/2412.21080"},"observation_digest":"sha256:e5a263a0c9e5b007dff88032217a2db02f2057feddb7bf66d6823809442de397","observation_id":"5b59425e-f21e-47eb-b220-cfc4b4b14382","resolution":{"observed_at":"2026-08-10T23:07:15.737841Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:07:15.720188Z","title":"Weakly supervised temporal sentence grounding with uncertainty-guided self- training","venue":null,"work_id":"1e0aeb00-f0d4-42e6-a38c-ef191f0eff6c","year":2023},"citing_paper":{"arxiv_id":"2412.21080","last_updated":"2024-12-30T16:57:05Z","snapshot_observed_at":"2026-08-12T17:46:33.884595Z","submitted_at":"2024-12-30T16:57:05Z","title":"Vinci: A Real-time Embodied Smart Assistant based on Egocentric Vision-Language Model","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:14.487063Z"},"links":{"citing_paper":"/paper/2412.21080"},"observation_digest":"sha256:a03d53804d3b22b7710c1b6a0c3648c887330288e08616281d675b76cc2680e9","observation_id":"57d405e9-0d19-42da-8818-f7f8fbfd345e","resolution":{"observed_at":"2026-08-10T23:07:15.724760Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:07:15.706415Z","title":"Egoexolearn: A dataset for bridging asyn- chronous ego-and exo-centric view of procedural activities in real world","venue":null,"work_id":"43f448ad-56ea-49cb-a552-0ec2c8ba4155","year":null},"citing_paper":{"arxiv_id":"2412.21080","last_updated":"2024-12-30T16:57:05Z","snapshot_observed_at":"2026-08-12T17:46:33.884595Z","submitted_at":"2024-12-30T16:57:05Z","title":"Vinci: A Real-time Embodied Smart Assistant based on Egocentric Vision-Language Model","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:14.491334Z"},"links":{"citing_paper":"/paper/2412.21080"},"observation_digest":"sha256:5d74d056a2a278cfd5f0179c5c594965d39e5bcc71e9028d011d74400b4d7442","observation_id":"01eab2a6-f1b0-4539-8199-7abbb6f3379d","resolution":{"observed_at":"2026-08-10T23:07:15.710985Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:07:15.693342Z","title":"VBench: Com- prehensive benchmark suite for video generative models","venue":null,"work_id":"8943b2db-0f1e-4b26-b466-ea94bb5ec72d","year":2024},"citing_paper":{"arxiv_id":"2412.21080","last_updated":"2024-12-30T16:57:05Z","snapshot_observed_at":"2026-08-12T17:46:33.884595Z","submitted_at":"2024-12-30T16:57:05Z","title":"Vinci: A Real-time Embodied Smart Assistant based on Egocentric Vision-Language Model","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:14.496055Z"},"links":{"citing_paper":"/paper/2412.21080"},"observation_digest":"sha256:5858fa56c66804db1e6e8243089988907a5881a35cb18348bdbe0fc31b653431","observation_id":"5f22b972-d73c-4811-af51-e593c90182bb","resolution":{"observed_at":"2026-08-10T23:07:15.697712Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13503","last_updated":"2024-11-20T17:54:41Z","snapshot_observed_at":"2026-08-12T19:44:40.357419Z","submitted_at":"2024-11-20T17:54:41Z","title":"VBench++: Comprehensive and Versatile Benchmark Suite for Video Generative Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.13503","snapshot_observed_at":"2026-08-10T23:07:14.500140Z","title":"Vbench++: Comprehensive and versatile benchmark suite for video generative models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.21080","last_updated":"2024-12-30T16:57:05Z","snapshot_observed_at":"2026-08-12T17:46:33.884595Z","submitted_at":"2024-12-30T16:57:05Z","title":"Vinci: A Real-time Embodied Smart Assistant based on Egocentric Vision-Language Model","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:14.500140Z"},"links":{"cited_paper":"/paper/2411.13503","citing_paper":"/paper/2412.21080"},"observation_digest":"sha256:badb1075a46690b5da54d5efd23221d8a14c4b51a17c7ff93abebc80d1031df0","observation_id":"f9607eb2-48f9-4602-b167-d3d1df282013","resolution":{"observed_at":"2026-08-10T23:07:14.500140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:07:15.680041Z","title":"Towards intelligent wearable assistants","venue":null,"work_id":"5665598e-1cc7-4f4b-a554-f77b18203cc2","year":2024},"citing_paper":{"arxiv_id":"2412.21080","last_updated":"2024-12-30T16:57:05Z","snapshot_observed_at":"2026-08-12T17:46:33.884595Z","submitted_at":"2024-12-30T16:57:05Z","title":"Vinci: A Real-time Embodied Smart Assistant based on Egocentric Vision-Language Model","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:14.504426Z"},"links":{"citing_paper":"/paper/2412.21080"},"observation_digest":"sha256:fedea09b5d3e587ef5f97b5a227e404978b7c7662e8375bf1c4f7a0c7848858e","observation_id":"5043d211-f39b-4b40-a2c1-030ab139a71d","resolution":{"observed_at":"2026-08-10T23:07:15.684460Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:07:15.666595Z","title":"Demonstrating tom: A de- velopment platform for wearable intelligent assistants","venue":null,"work_id":"10e75128-75dc-48b4-a678-8f1d440909a0","year":2024},"citing_paper":{"arxiv_id":"2412.21080","last_updated":"2024-12-30T16:57:05Z","snapshot_observed_at":"2026-08-12T17:46:33.884595Z","submitted_at":"2024-12-30T16:57:05Z","title":"Vinci: A Real-time Embodied Smart Assistant based on Egocentric Vision-Language Model","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:14.508558Z"},"links":{"citing_paper":"/paper/2412.21080"},"observation_digest":"sha256:63c0905974d29f6241bb9c3d9abaff6c43c6aa854431af4a7bb5330ae0a354f3","observation_id":"8a9609b7-fd27-44df-89d7-959602087926","resolution":{"observed_at":"2026-08-10T23:07:15.671108Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:07:15.652663Z","title":"Lemma: A multi-view dataset for le arning m ulti-agent m ulti-task a ctivities","venue":null,"work_id":"4513312f-b3f7-4978-a74e-3b673b1f4ba4","year":2020},"citing_paper":{"arxiv_id":"2412.21080","last_updated":"2024-12-30T16:57:05Z","snapshot_observed_at":"2026-08-12T17:46:33.884595Z","submitted_at":"2024-12-30T16:57:05Z","title":"Vinci: A Real-time Embodied Smart Assistant based on Egocentric Vision-Language Model","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:14.512646Z"},"links":{"citing_paper":"/paper/2412.21080"},"observation_digest":"sha256:f93687547cc7f2ef80a26c12bb26e5a1b6a2f0f84b4cb8e7d7eb91cbfe89c2f3","observation_id":"a2c1f624-2e61-4721-85f2-6f3069ba72f2","resolution":{"observed_at":"2026-08-10T23:07:15.657731Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:07:15.638627Z","title":"Epic-fusion: Audio-visual temporal binding for egocentric action recognition","venue":null,"work_id":"275307af-bd76-47fd-9091-57a3870bdca3","year":2019},"citing_paper":{"arxiv_id":"2412.21080","last_updated":"2024-12-30T16:57:05Z","snapshot_observed_at":"2026-08-12T17:46:33.884595Z","submitted_at":"2024-12-30T16:57:05Z","title":"Vinci: A Real-time Embodied Smart Assistant based on Egocentric Vision-Language Model","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:14.516836Z"},"links":{"citing_paper":"/paper/2412.21080"},"observation_digest":"sha256:ade203c5dbc1ba503136d762e426598d8b465b9e2364b98ebf9fadc2997b2415","observation_id":"37a921ba-fa10-4e25-899a-45e7e0fa65ab","resolution":{"observed_at":"2026-08-10T23:07:15.643272Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:07:15.623760Z","title":"Time- conditioned action anticipation in one shot","venue":null,"work_id":"ffb18f7f-1b1d-4192-821a-7ab5db4fb8e7","year":2019},"citing_paper":{"arxiv_id":"2412.21080","last_updated":"2024-12-30T16:57:05Z","snapshot_observed_at":"2026-08-12T17:46:33.884595Z","submitted_at":"2024-12-30T16:57:05Z","title":"Vinci: A Real-time Embodied Smart Assistant based on Egocentric Vision-Language Model","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:14.520886Z"},"links":{"citing_paper":"/paper/2412.21080"},"observation_digest":"sha256:5333a1c1d63180a52f4932112086d5f6f7e5dc7786341af0cd2d5955c27ab5b1","observation_id":"7f0aeb99-c015-42ee-b426-06c7b4d2d990","resolution":{"observed_at":"2026-08-10T23:07:15.628326Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:07:15.608852Z","title":"Learning to discriminate information for online action detection: Anal- ysis and application","venue":null,"work_id":"e7a2c4f9-ab0c-44ad-a98d-d097987bf3f7","year":2023},"citing_paper":{"arxiv_id":"2412.21080","last_updated":"2024-12-30T16:57:05Z","snapshot_observed_at":"2026-08-12T17:46:33.884595Z","submitted_at":"2024-12-30T16:57:05Z","title":"Vinci: A Real-time Embodied Smart Assistant based on Egocentric Vision-Language Model","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:14.525005Z"},"links":{"citing_paper":"/paper/2412.21080"},"observation_digest":"sha256:46e841f95984f251d7cc77fce3126cac81394e159aff14ef95fbfb9bb5dd455a","observation_id":"6f55c37f-ffd7-4ebf-bccc-598ff346f20c","resolution":{"observed_at":"2026-08-10T23:07:15.613474Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:07:15.595123Z","title":"Ego-body pose es- timation via ego-head pose estimation","venue":null,"work_id":"b347f9fb-1702-457e-90b2-7f44ec09f00a","year":2023},"citing_paper":{"arxiv_id":"2412.21080","last_updated":"2024-12-30T16:57:05Z","snapshot_observed_at":"2026-08-12T17:46:33.884595Z","submitted_at":"2024-12-30T16:57:05Z","title":"Vinci: A Real-time Embodied Smart Assistant based on Egocentric Vision-Language Model","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:14.529118Z"},"links":{"citing_paper":"/paper/2412.21080"},"observation_digest":"sha256:89654b400bfa4d3c7731acf7d80640ba90309a4c2c22b16c02cd7a43d45529c8","observation_id":"033e8250-9af6-4c50-bc38-847af0fefbc8","resolution":{"observed_at":"2026-08-10T23:07:15.599451Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06355","last_updated":"2024-01-04T02:06:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-10T17:59:04Z","title":"VideoChat: Chat-Centric Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06355","snapshot_observed_at":"2026-08-10T23:07:14.533205Z","title":"Videochat: Chat-centric video understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.21080","last_updated":"2024-12-30T16:57:05Z","snapshot_observed_at":"2026-08-12T17:46:33.884595Z","submitted_at":"2024-12-30T16:57:05Z","title":"Vinci: A Real-time Embodied Smart Assistant based on Egocentric Vision-Language Model","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:14.533205Z"},"links":{"cited_paper":"/paper/2305.06355","citing_paper":"/paper/2412.21080"},"observation_digest":"sha256:ef5000a8694b7157fea86fe0544ea815c7580ebd3d0320f7ed6e4c765d500da1","observation_id":"ab47944e-5706-4a95-8f8d-40b98bedb0f2","resolution":{"observed_at":"2026-08-10T23:07:14.533205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:07:15.581407Z","title":"Jointly localizing and describing events for dense video captioning","venue":null,"work_id":"77669565-157d-4e40-8452-3395e25d8d2d","year":null},"citing_paper":{"arxiv_id":"2412.21080","last_updated":"2024-12-30T16:57:05Z","snapshot_observed_at":"2026-08-12T17:46:33.884595Z","submitted_at":"2024-12-30T16:57:05Z","title":"Vinci: A Real-time Embodied Smart Assistant based on Egocentric Vision-Language Model","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:14.537667Z"},"links":{"citing_paper":"/paper/2412.21080"},"observation_digest":"sha256:b8a73283f1f4488b0522dd7c94b0e44a26cdbbbfa46d44a3abce8f4d174f4bba","observation_id":"d3818a83-dd62-4b37-8639-268bd91027d6","resolution":{"observed_at":"2026-08-10T23:07:15.585995Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:07:15.566560Z","title":"Egocentric video-language pretraining","venue":null,"work_id":"bef425f3-586e-4683-8e53-0dc19a5ff6dd","year":2022},"citing_paper":{"arxiv_id":"2412.21080","last_updated":"2024-12-30T16:57:05Z","snapshot_observed_at":"2026-08-12T17:46:33.884595Z","submitted_at":"2024-12-30T16:57:05Z","title":"Vinci: A Real-time Embodied Smart Assistant based on Egocentric Vision-Language Model","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:14.541881Z"},"links":{"citing_paper":"/paper/2412.21080"},"observation_digest":"sha256:88dcdc0ac4c99836de6c1c43873cbf65f7060b9b864d0076fa1597a21a856823","observation_id":"555b75c5-1459-4a1f-b9ae-1e22cf884672","resolution":{"observed_at":"2026-08-10T23:07:15.571544Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:07:15.552177Z","title":"Univtg: Towards unified video-language temporal grounding","venue":null,"work_id":"0f018f54-13bf-4077-8a6e-e9f2649fec17","year":null},"citing_paper":{"arxiv_id":"2412.21080","last_updated":"2024-12-30T16:57:05Z","snapshot_observed_at":"2026-08-12T17:46:33.884595Z","submitted_at":"2024-12-30T16:57:05Z","title":"Vinci: A Real-time Embodied Smart Assistant based on Egocentric Vision-Language Model","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:14.546735Z"},"links":{"citing_paper":"/paper/2412.21080"},"observation_digest":"sha256:ae9486bf119936503246efd954e52d0e10ae10988c0f1b27a4ee9f42939a146c","observation_id":"8b7c6741-4a86-42e0-aee9-fb177c7aa4c2","resolution":{"observed_at":"2026-08-10T23:07:15.557145Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:07:14.551203Z","title":"Visual instruction tuning, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.21080","last_updated":"2024-12-30T16:57:05Z","snapshot_observed_at":"2026-08-12T17:46:33.884595Z","submitted_at":"2024-12-30T16:57:05Z","title":"Vinci: A Real-time Embodied Smart Assistant based on Egocentric Vision-Language Model","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:14.551203Z"},"links":{"citing_paper":"/paper/2412.21080"},"observation_digest":"sha256:ac825817690f1c9eec8b80bca11e15d81058967ab5aa2c2c9c4b92049b6417c8","observation_id":"497a0e72-4612-42d2-9410-fd80b9bbd3c7","resolution":{"observed_at":"2026-08-10T23:07:14.551203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:07:14.555241Z","title":"Llava-next: Improved reason- ing, ocr, and world knowledge, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.21080","last_updated":"2024-12-30T16:57:05Z","snapshot_observed_at":"2026-08-12T17:46:33.884595Z","submitted_at":"2024-12-30T16:57:05Z","title":"Vinci: A Real-time Embodied Smart Assistant based on Egocentric Vision-Language Model","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:14.555241Z"},"links":{"citing_paper":"/paper/2412.21080"},"observation_digest":"sha256:c1d971316a21dafa7fa1288794b45d69c20c07b96a269c0b05a4ea4a1da5f6a6","observation_id":"f691b753-7a40-4925-8a99-9d714bcb9a69","resolution":{"observed_at":"2026-08-10T23:07:14.555241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:07:15.519788Z","title":"Video summariza- tion through reinforcement learning with a 3d spatio-temporal u-net","venue":null,"work_id":"94d6dab0-97b7-447b-a770-6336bd399984","year":2022},"citing_paper":{"arxiv_id":"2412.21080","last_updated":"2024-12-30T16:57:05Z","snapshot_observed_at":"2026-08-12T17:46:33.884595Z","submitted_at":"2024-12-30T16:57:05Z","title":"Vinci: A Real-time Embodied Smart Assistant based on Egocentric Vision-Language Model","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:14.559366Z"},"links":{"citing_paper":"/paper/2412.21080"},"observation_digest":"sha256:cd214bf853d9d2c617d46145f191c9b340dea8333ce7cbef1898dde2694415d1","observation_id":"8ce5f307-e0e7-49f3-8b7b-845bbfca09bc","resolution":{"observed_at":"2026-08-10T23:07:15.524779Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.03048","last_updated":"2025-05-01T09:40:21Z","snapshot_observed_at":"2026-08-13T10:28:06.516901Z","submitted_at":"2024-01-05T19:55:15Z","title":"Latte: Latent Diffusion Transformer for Video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.03048","snapshot_observed_at":"2026-08-10T23:07:14.563844Z","title":"Latte: Latent diffusion transformer for video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.21080","last_updated":"2024-12-30T16:57:05Z","snapshot_observed_at":"2026-08-12T17:46:33.884595Z","submitted_at":"2024-12-30T16:57:05Z","title":"Vinci: A Real-time Embodied Smart Assistant based on Egocentric Vision-Language Model","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:14.563844Z"},"links":{"cited_paper":"/paper/2401.03048","citing_paper":"/paper/2412.21080"},"observation_digest":"sha256:6d402f2ce7ff78d37bb633d7c1793e2aea6eaeb877c4f7387e3681354fe9aca3","observation_id":"342c998e-cb91-489a-a796-84db9e2d074e","resolution":{"observed_at":"2026-08-10T23:07:14.563844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.16934","last_updated":"2025-12-19T22:01:32Z","snapshot_observed_at":"2026-08-12T12:41:24.269680Z","submitted_at":"2024-11-25T21:07:25Z","title":"Online Episodic Memory Visual Query Localization with Egocentric Streaming Object Memory","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.16934","snapshot_observed_at":"2026-08-10T23:07:14.568307Z","title":"Online episodic memory visual query localization with egocentric streaming object memory","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.21080","last_updated":"2024-12-30T16:57:05Z","snapshot_observed_at":"2026-08-12T17:46:33.884595Z","submitted_at":"2024-12-30T16:57:05Z","title":"Vinci: A Real-time Embodied Smart Assistant based on Egocentric Vision-Language Model","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:14.568307Z"},"links":{"cited_paper":"/paper/2411.16934","citing_paper":"/paper/2412.21080"},"observation_digest":"sha256:e703e39f0d937ca6279357ce3a52c6cc55dae72252d483b5b2dbf3532d794d5b","observation_id":"fe3883d7-c724-4e51-9add-9f19b4d31f53","resolution":{"observed_at":"2026-08-10T23:07:14.568307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:07:15.506549Z","title":"HowTo100M: Learning a Text-Video Embedding by Watching Hundred Million Narrated Video Clips","venue":null,"work_id":"5e29680b-74ee-4814-84ec-ed3485dd3641","year":2019},"citing_paper":{"arxiv_id":"2412.21080","last_updated":"2024-12-30T16:57:05Z","snapshot_observed_at":"2026-08-12T17:46:33.884595Z","submitted_at":"2024-12-30T16:57:05Z","title":"Vinci: A Real-time Embodied Smart Assistant based on Egocentric Vision-Language Model","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:14.572712Z"},"links":{"citing_paper":"/paper/2412.21080"},"observation_digest":"sha256:0b370cf4af778d80007f024ad5303f9c6e07e6012de2259fe5754f5958903b42","observation_id":"32dc1b55-0211-4429-8a17-76bb31f0c17b","resolution":{"observed_at":"2026-08-10T23:07:15.510814Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:07:15.491852Z","title":"Integrating human gaze into attention for egocentric activity recognition","venue":null,"work_id":"f30bda83-ac77-45ea-9931-545aa3453014","year":2021},"citing_paper":{"arxiv_id":"2412.21080","last_updated":"2024-12-30T16:57:05Z","snapshot_observed_at":"2026-08-12T17:46:33.884595Z","submitted_at":"2024-12-30T16:57:05Z","title":"Vinci: A Real-time Embodied Smart Assistant based on Egocentric Vision-Language Model","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:14.576732Z"},"links":{"citing_paper":"/paper/2412.21080"},"observation_digest":"sha256:7df03d4926907b3a190f132d5e8e67b2d1fc60f8a8733b172c13c815d3934bea","observation_id":"6cd379de-9fe6-4d5c-9a60-6585048f0de1","resolution":{"observed_at":"2026-08-10T23:07:15.496469Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:07:15.478324Z","title":"Learning affordance landscapes for interaction exploration in 3d environments","venue":null,"work_id":"57fa658e-4e71-452a-8a81-f63012f9866f","year":2020},"citing_paper":{"arxiv_id":"2412.21080","last_updated":"2024-12-30T16:57:05Z","snapshot_observed_at":"2026-08-12T17:46:33.884595Z","submitted_at":"2024-12-30T16:57:05Z","title":"Vinci: A Real-time Embodied Smart Assistant based on Egocentric Vision-Language Model","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:14.581234Z"},"links":{"citing_paper":"/paper/2412.21080"},"observation_digest":"sha256:c6469bfa102006c12dce6f1472d5efa5543f70953015b84831b9e3da7846b877","observation_id":"ed6c5aa4-8cde-446b-82d6-450e3f548839","resolution":{"observed_at":"2026-08-10T23:07:15.482815Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:07:15.464688Z","title":"Egoenv: Human- centric environment representations from egocentric video","venue":null,"work_id":"eeb60e82-b285-41c5-bb22-dfa3371c44a1","year":2023},"citing_paper":{"arxiv_id":"2412.21080","last_updated":"2024-12-30T16:57:05Z","snapshot_observed_at":"2026-08-12T17:46:33.884595Z","submitted_at":"2024-12-30T16:57:05Z","title":"Vinci: A Real-time Embodied Smart Assistant based on Egocentric Vision-Language Model","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:14.585398Z"},"links":{"citing_paper":"/paper/2412.21080"},"observation_digest":"sha256:180663e57ccbe2ae4c74f158c6216e805cdf6168eeedac1bd2d2cd5b9a6d71df","observation_id":"2d62998d-ebd2-4b6e-bd18-f88fb293ecff","resolution":{"observed_at":"2026-08-10T23:07:15.469334Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:07:14.589425Z","title":"Gpt-4v(ision) system card","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.21080","last_updated":"2024-12-30T16:57:05Z","snapshot_observed_at":"2026-08-12T17:46:33.884595Z","submitted_at":"2024-12-30T16:57:05Z","title":"Vinci: A Real-time Embodied Smart Assistant based on Egocentric Vision-Language Model","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:14.589425Z"},"links":{"citing_paper":"/paper/2412.21080"},"observation_digest":"sha256:fce4d44e20cf80ac30180f2f275c3132c5cbd64af98408ec9f60724f1953f61b","observation_id":"2e359030-db96-472c-a8fb-ec4463a52fb7","resolution":{"observed_at":"2026-08-10T23:07:14.589425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:07:15.443260Z","title":"Hello gpt-4o","venue":null,"work_id":"080da3be-ee4d-4b66-9eb5-aea1be3a6c94","year":2024},"citing_paper":{"arxiv_id":"2412.21080","last_updated":"2024-12-30T16:57:05Z","snapshot_observed_at":"2026-08-12T17:46:33.884595Z","submitted_at":"2024-12-30T16:57:05Z","title":"Vinci: A Real-time Embodied Smart Assistant based on Egocentric Vision-Language Model","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:14.593620Z"},"links":{"citing_paper":"/paper/2412.21080"},"observation_digest":"sha256:fbcb7076b275d34ca7efac5ed790630eea5851bf17c0539aa6e3e74340362883","observation_id":"938812b2-fc71-4fcc-9b59-d0733978175e","resolution":{"observed_at":"2026-08-10T23:07:15.447088Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:07:15.430084Z","title":"Actionvos: Actions as prompts for video object segmentation","venue":null,"work_id":"4e0d783a-78ae-4b47-9e34-e952dd6861c9","year":2024},"citing_paper":{"arxiv_id":"2412.21080","last_updated":"2024-12-30T16:57:05Z","snapshot_observed_at":"2026-08-12T17:46:33.884595Z","submitted_at":"2024-12-30T16:57:05Z","title":"Vinci: A Real-time Embodied Smart Assistant based on Egocentric Vision-Language Model","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:14.598767Z"},"links":{"citing_paper":"/paper/2412.21080"},"observation_digest":"sha256:36f4e54f14a1b8ac8f6b8d5e86125158630e9dcbec3ebd37b91c27cfc100a871","observation_id":"7b5445b0-eb61-4d24-b845-e537c137950a","resolution":{"observed_at":"2026-08-10T23:07:15.434344Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:07:15.416929Z","title":"Wear- able augmented reality system using gaze interaction","venue":null,"work_id":"c9086114-2c3c-4179-be30-3107d83d0c0a","year":2008},"citing_paper":{"arxiv_id":"2412.21080","last_updated":"2024-12-30T16:57:05Z","snapshot_observed_at":"2026-08-12T17:46:33.884595Z","submitted_at":"2024-12-30T16:57:05Z","title":"Vinci: A Real-time Embodied Smart Assistant based on Egocentric Vision-Language Model","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:14.602833Z"},"links":{"citing_paper":"/paper/2412.21080"},"observation_digest":"sha256:d6fa2a1dd76f5a96b5b787e3db6d1d3f6838d88d8ed16cc4e2b0c1bbbaa5efc4","observation_id":"2a983fef-1a55-4d00-bcfc-90257592f88d","resolution":{"observed_at":"2026-08-10T23:07:15.421551Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:07:15.404237Z","title":"Deep learning-based smart task assistance in wearable augmented reality","venue":null,"work_id":"3a11793a-f488-45d3-9fa5-298db30192e0","year":2020},"citing_paper":{"arxiv_id":"2412.21080","last_updated":"2024-12-30T16:57:05Z","snapshot_observed_at":"2026-08-12T17:46:33.884595Z","submitted_at":"2024-12-30T16:57:05Z","title":"Vinci: A Real-time Embodied Smart Assistant based on Egocentric Vision-Language Model","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:14.606907Z"},"links":{"citing_paper":"/paper/2412.21080"},"observation_digest":"sha256:3782c4b92f6cdcad1bc7910114a1cdb8a43190767081db447ac1e23d9f1f0851","observation_id":"4afb15f6-053e-426f-b60c-2f45d49edb71","resolution":{"observed_at":"2026-08-10T23:07:15.408485Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18070","last_updated":"2024-07-01T02:44:11Z","snapshot_observed_at":"2026-08-12T23:34:48.223610Z","submitted_at":"2024-06-26T05:01:37Z","title":"EgoVideo: Exploring Egocentric Foundation Model and Downstream Adaptation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18070","snapshot_observed_at":"2026-08-10T23:07:14.610984Z","title":"Egovideo: Exploring egocentric foun- dation model and downstream adaptation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.21080","last_updated":"2024-12-30T16:57:05Z","snapshot_observed_at":"2026-08-12T17:46:33.884595Z","submitted_at":"2024-12-30T16:57:05Z","title":"Vinci: A Real-time Embodied Smart Assistant based on Egocentric Vision-Language Model","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:14.610984Z"},"links":{"cited_paper":"/paper/2406.18070","citing_paper":"/paper/2412.21080"},"observation_digest":"sha256:17012d63bdff561a923d14aa995852fbd248b5e83b09752be0f4eb3d5bc3ba74","observation_id":"d4308c20-0da5-4c3f-84bc-367fcd7924b8","resolution":{"observed_at":"2026-08-10T23:07:14.610984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.07123","last_updated":"2024-02-07T14:37:42Z","snapshot_observed_at":"2026-08-13T10:34:57.214609Z","submitted_at":"2023-08-14T13:10:48Z","title":"An Outlook into the Future of Egocentric Vision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.07123","snapshot_observed_at":"2026-08-10T23:07:14.615737Z","title":"An outlook into the future of egocentric vision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.21080","last_updated":"2024-12-30T16:57:05Z","snapshot_observed_at":"2026-08-12T17:46:33.884595Z","submitted_at":"2024-12-30T16:57:05Z","title":"Vinci: A Real-time Embodied Smart Assistant based on Egocentric Vision-Language Model","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:14.615737Z"},"links":{"cited_paper":"/paper/2308.07123","citing_paper":"/paper/2412.21080"},"observation_digest":"sha256:1081a44159b6335e40d7e6689a31dc382581692b571148bb867ada29358e2b39","observation_id":"8420b244-53af-4be1-a537-30ec777c7384","resolution":{"observed_at":"2026-08-10T23:07:14.615737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.05072","last_updated":"2025-01-21T21:33:06Z","snapshot_observed_at":"2026-08-13T00:35:28.014771Z","submitted_at":"2024-04-07T21:00:14Z","title":"Spatial Cognition from Egocentric Video: Out of Sight, Not Out of Mind","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.05072","snapshot_observed_at":"2026-08-10T23:07:14.620320Z","title":"Spatial cognition from egocentric video: Out of sight, not out of mind.arXiv preprint arXiv:2404.05072, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.21080","last_updated":"2024-12-30T16:57:05Z","snapshot_observed_at":"2026-08-12T17:46:33.884595Z","submitted_at":"2024-12-30T16:57:05Z","title":"Vinci: A Real-time Embodied Smart Assistant based on Egocentric Vision-Language Model","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:14.620320Z"},"links":{"cited_paper":"/paper/2404.05072","citing_paper":"/paper/2412.21080"},"observation_digest":"sha256:edec57a4ca6605e761cfe7dc78f4dc68d61e427530e78cc5f3ee77157b63a7a2","observation_id":"e3853078-fcfb-40fc-8cc1-f4888ae96575","resolution":{"observed_at":"2026-08-10T23:07:14.620320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:07:15.390567Z","title":"Egovlpv2: Egocentric video-language pre-training with fusion in the backbone","venue":null,"work_id":"985cf798-ffd5-4fef-82da-68fb4749e760","year":null},"citing_paper":{"arxiv_id":"2412.21080","last_updated":"2024-12-30T16:57:05Z","snapshot_observed_at":"2026-08-12T17:46:33.884595Z","submitted_at":"2024-12-30T16:57:05Z","title":"Vinci: A Real-time Embodied Smart Assistant based on Egocentric Vision-Language Model","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:14.624620Z"},"links":{"citing_paper":"/paper/2412.21080"},"observation_digest":"sha256:8dc99cd7bb8da3944e154afaee3d5810e95f896f2c125407a927f9842d0d8693","observation_id":"57f3df04-9bd8-4ea8-b715-bfa70ff40e5d","resolution":{"observed_at":"2026-08-10T23:07:15.395284Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:07:15.377729Z","title":"Streaming long video understanding with large language models, 2024","venue":null,"work_id":"e5171255-da6d-461b-8ffb-a7dfcd6b3e6a","year":2024},"citing_paper":{"arxiv_id":"2412.21080","last_updated":"2024-12-30T16:57:05Z","snapshot_observed_at":"2026-08-12T17:46:33.884595Z","submitted_at":"2024-12-30T16:57:05Z","title":"Vinci: A Real-time Embodied Smart Assistant based on Egocentric Vision-Language Model","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:14.628691Z"},"links":{"citing_paper":"/paper/2412.21080"},"observation_digest":"sha256:8722fa445f62d7acb8f73933601892a0da9cfc9b86800dc8ba32934487768c0a","observation_id":"8ac2dbfe-8937-49b8-abff-77075bfa34ab","resolution":{"observed_at":"2026-08-10T23:07:15.382002Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:07:15.363748Z","title":"Sener, D","venue":null,"work_id":"9df470dd-574f-4e48-a127-7542b1a03657","year":2022},"citing_paper":{"arxiv_id":"2412.21080","last_updated":"2024-12-30T16:57:05Z","snapshot_observed_at":"2026-08-12T17:46:33.884595Z","submitted_at":"2024-12-30T16:57:05Z","title":"Vinci: A Real-time Embodied Smart Assistant based on Egocentric Vision-Language Model","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:14.633110Z"},"links":{"citing_paper":"/paper/2412.21080"},"observation_digest":"sha256:f50e66bdb2d3a5dc8359600ecd622508db91b9f995eebd24796b4792cbce3c7d","observation_id":"5b4a8357-e9e3-4b64-9660-1b69d82fe91a","resolution":{"observed_at":"2026-08-10T23:07:15.368150Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:07:15.350589Z","title":"Understanding human hands in contact at internet scale","venue":null,"work_id":"871fa4d4-ae2b-4216-89df-9046d6477c64","year":2020},"citing_paper":{"arxiv_id":"2412.21080","last_updated":"2024-12-30T16:57:05Z","snapshot_observed_at":"2026-08-12T17:46:33.884595Z","submitted_at":"2024-12-30T16:57:05Z","title":"Vinci: A Real-time Embodied Smart Assistant based on Egocentric Vision-Language Model","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:14.637413Z"},"links":{"citing_paper":"/paper/2412.21080"},"observation_digest":"sha256:75b51a4ccde8c694e83d187105b4c4f164eeaf08df0f800ff1b35f1c682a79d5","observation_id":"3d42fe93-c5a6-4946-b197-a4ad4620c5b4","resolution":{"observed_at":"2026-08-10T23:07:15.355037Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1804.09626","last_updated":"2018-04-30T16:57:00Z","snapshot_observed_at":"2026-08-07T16:08:52.487917Z","submitted_at":"2018-04-25T15:30:27Z","title":"Charades-Ego: A Large-Scale Dataset of Paired Third and First Person Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1804.09626","snapshot_observed_at":"2026-08-10T23:07:14.641633Z","title":"Charades-ego: A large-scale dataset of paired third and first person videos","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.21080","last_updated":"2024-12-30T16:57:05Z","snapshot_observed_at":"2026-08-12T17:46:33.884595Z","submitted_at":"2024-12-30T16:57:05Z","title":"Vinci: A Real-time Embodied Smart Assistant based on Egocentric Vision-Language Model","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:14.641633Z"},"links":{"cited_paper":"/paper/1804.09626","citing_paper":"/paper/2412.21080"},"observation_digest":"sha256:5eba6d4121719c5bbc3889104d4c1850c79694c6c04c4b45390deb1f0f637f66","observation_id":"0e27b10e-9437-4c19-b883-ebf2237264d5","resolution":{"observed_at":"2026-08-10T23:07:14.641633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:07:15.337712Z","title":"Towards diverse paragraph captioning for untrimmed videos","venue":null,"work_id":"eb349d7a-a0ed-45ca-aed3-da58ea008e98","year":2021},"citing_paper":{"arxiv_id":"2412.21080","last_updated":"2024-12-30T16:57:05Z","snapshot_observed_at":"2026-08-12T17:46:33.884595Z","submitted_at":"2024-12-30T16:57:05Z","title":"Vinci: A Real-time Embodied Smart Assistant based on Egocentric Vision-Language Model","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:14.645828Z"},"links":{"citing_paper":"/paper/2412.21080"},"observation_digest":"sha256:0277bb79f26f74553713ed8a18ee7e503fd22a5750a8531d9070e463b575c040","observation_id":"77f1364a-4339-4342-9e57-e2ed89ed533c","resolution":{"observed_at":"2026-08-10T23:07:15.342012Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:07:15.324622Z","title":"Ego4d goal-step: Toward hierarchical understanding of procedural activities","venue":null,"work_id":"b7cab9cc-dd4e-4314-9ff6-efe254cff71d","year":2024},"citing_paper":{"arxiv_id":"2412.21080","last_updated":"2024-12-30T16:57:05Z","snapshot_observed_at":"2026-08-12T17:46:33.884595Z","submitted_at":"2024-12-30T16:57:05Z","title":"Vinci: A Real-time Embodied Smart Assistant based on Egocentric Vision-Language Model","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:14.650645Z"},"links":{"citing_paper":"/paper/2412.21080"},"observation_digest":"sha256:e4868268b974cd15c00a1f6348bd4b670a494e8f7b21308386d1dd05fcca6ce1","observation_id":"4e0cec2e-e935-4890-9a0a-3a188af385ec","resolution":{"observed_at":"2026-08-10T23:07:15.329069Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:07:15.310798Z","title":"H+ o: Unified egocentric recognition of 3d hand-object poses and interactions","venue":null,"work_id":"100965e2-c159-4cbc-9a40-6ae1057686fe","year":null},"citing_paper":{"arxiv_id":"2412.21080","last_updated":"2024-12-30T16:57:05Z","snapshot_observed_at":"2026-08-12T17:46:33.884595Z","submitted_at":"2024-12-30T16:57:05Z","title":"Vinci: A Real-time Embodied Smart Assistant based on Egocentric Vision-Language Model","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:14.654852Z"},"links":{"citing_paper":"/paper/2412.21080"},"observation_digest":"sha256:853fd86853b1f0d0d651dea3be63ee1521ecbf372346b3ee09ede623a8752d8a","observation_id":"fb3115e4-9c67-4df4-8146-ae45bb403574","resolution":{"observed_at":"2026-08-10T23:07:15.316166Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:07:15.297578Z","title":"Memory-and-anticipation transformer for online action understanding","venue":null,"work_id":"293d321b-3f9d-44e1-b2c4-d914385e5abd","year":2023},"citing_paper":{"arxiv_id":"2412.21080","last_updated":"2024-12-30T16:57:05Z","snapshot_observed_at":"2026-08-12T17:46:33.884595Z","submitted_at":"2024-12-30T16:57:05Z","title":"Vinci: A Real-time Embodied Smart Assistant based on Egocentric Vision-Language Model","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:14.658845Z"},"links":{"citing_paper":"/paper/2412.21080"},"observation_digest":"sha256:71110d4f275ee34ff484c9bebf08d00852d95ed48fafd0f325626c901c5c6951","observation_id":"5561dfa5-0ae8-417f-b133-8c3e6663bf47","resolution":{"observed_at":"2026-08-10T23:07:15.302082Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:07:15.284149Z","title":"Scene-aware ego- centric 3d human pose estimation","venue":null,"work_id":"a6355bda-06fb-49db-915f-9d534d3c8780","year":null},"citing_paper":{"arxiv_id":"2412.21080","last_updated":"2024-12-30T16:57:05Z","snapshot_observed_at":"2026-08-12T17:46:33.884595Z","submitted_at":"2024-12-30T16:57:05Z","title":"Vinci: A Real-time Embodied Smart Assistant based on Egocentric Vision-Language Model","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:14.663095Z"},"links":{"citing_paper":"/paper/2412.21080"},"observation_digest":"sha256:0d381d9b30ca3de9485e73647b5d422fd51fdf0448c57ec6e290063513abd2a4","observation_id":"6e38406f-8142-4d7d-aebe-d4fd380e192e","resolution":{"observed_at":"2026-08-10T23:07:15.288716Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-10T23:07:14.668469Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.21080","last_updated":"2024-12-30T16:57:05Z","snapshot_observed_at":"2026-08-12T17:46:33.884595Z","submitted_at":"2024-12-30T16:57:05Z","title":"Vinci: A Real-time Embodied Smart Assistant based on Egocentric Vision-Language Model","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:14.668469Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2412.21080"},"observation_digest":"sha256:1cbebf9cee9025f494abbecf09ec0dfbc803b11c9df5b8d82453792c32011521","observation_id":"48a2e583-2d61-44fd-a5fc-bc6e31e7b6bd","resolution":{"observed_at":"2026-08-10T23:07:14.668469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:07:15.270763Z","title":null,"venue":null,"work_id":"ff84b950-c38e-4dd9-85cd-20ea36632c1b","year":2019},"citing_paper":{"arxiv_id":"2412.21080","last_updated":"2024-12-30T16:57:05Z","snapshot_observed_at":"2026-08-12T17:46:33.884595Z","submitted_at":"2024-12-30T16:57:05Z","title":"Vinci: A Real-time Embodied Smart Assistant based on Egocentric Vision-Language Model","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:14.672801Z"},"links":{"citing_paper":"/paper/2412.21080"},"observation_digest":"sha256:00622e491893fa67838e66bc0c5eea5e1128a040d90d15d1e8d2c976d6ccb674","observation_id":"fa3e5392-a256-4d5e-b7b3-539d03256832","resolution":{"observed_at":"2026-08-10T23:07:15.275336Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:07:15.257407Z","title":"Lavie: High-quality video generation with cascaded latent diffusion models","venue":null,"work_id":"eb99d9dd-25c2-42c7-adb2-8157d882302c","year":2024},"citing_paper":{"arxiv_id":"2412.21080","last_updated":"2024-12-30T16:57:05Z","snapshot_observed_at":"2026-08-12T17:46:33.884595Z","submitted_at":"2024-12-30T16:57:05Z","title":"Vinci: A Real-time Embodied Smart Assistant based on Egocentric Vision-Language Model","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:14.677185Z"},"links":{"citing_paper":"/paper/2412.21080"},"observation_digest":"sha256:d5398e3172a439d2464895d47d991e1ac6adfa55f7d15330493e8dfdc9702ca5","observation_id":"c7ba0f18-9f9e-46ca-ba13-7896ae059b56","resolution":{"observed_at":"2026-08-10T23:07:15.261999Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:07:15.243486Z","title":"In- ternvideo2: Scaling foundation models for multimodal video understanding","venue":null,"work_id":"a80ed994-6b08-4088-ba60-1830b18e35f6","year":2024},"citing_paper":{"arxiv_id":"2412.21080","last_updated":"2024-12-30T16:57:05Z","snapshot_observed_at":"2026-08-12T17:46:33.884595Z","submitted_at":"2024-12-30T16:57:05Z","title":"Vinci: A Real-time Embodied Smart Assistant based on Egocentric Vision-Language Model","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:14.681282Z"},"links":{"citing_paper":"/paper/2412.21080"},"observation_digest":"sha256:2968d922cf2900ec30edbdd272d3604ad3108448c4b83f605463d9266b3774e8","observation_id":"6f18991b-1848-4299-9076-7ae89dc2e674","resolution":{"observed_at":"2026-08-10T23:07:15.248022Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:07:15.229842Z","title":"Vide- ollm knows when to speak: Enhancing time-sensitive video comprehension with video-text duet interaction format, 2024","venue":null,"work_id":"21391039-42e5-4120-bcb6-d44b87484db2","year":2024},"citing_paper":{"arxiv_id":"2412.21080","last_updated":"2024-12-30T16:57:05Z","snapshot_observed_at":"2026-08-12T17:46:33.884595Z","submitted_at":"2024-12-30T16:57:05Z","title":"Vinci: A Real-time Embodied Smart Assistant based on Egocentric Vision-Language Model","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:14.685720Z"},"links":{"citing_paper":"/paper/2412.21080"},"observation_digest":"sha256:5a82300a0083f5c2622d34b55f4a4337a9b46614964114d8a94a0dfc4fc6c96b","observation_id":"1c5e0a52-90b1-47f4-a653-29aa26d6f1ad","resolution":{"observed_at":"2026-08-10T23:07:15.234972Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:07:15.216061Z","title":"Gaze-enabled egocentric video summarization via constrained submodular maximiza- tion","venue":null,"work_id":"8b3e2cef-999d-4e59-94d3-610600fbe38b","year":2015},"citing_paper":{"arxiv_id":"2412.21080","last_updated":"2024-12-30T16:57:05Z","snapshot_observed_at":"2026-08-12T17:46:33.884595Z","submitted_at":"2024-12-30T16:57:05Z","title":"Vinci: A Real-time Embodied Smart Assistant based on Egocentric Vision-Language Model","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:14.689868Z"},"links":{"citing_paper":"/paper/2412.21080"},"observation_digest":"sha256:56faf32d50cfe3a51d296075d8d147eae8567bcc893cc0ae2cd7df3de589038f","observation_id":"7f1babe2-6713-49e2-b355-bf6c3774d7d8","resolution":{"observed_at":"2026-08-10T23:07:15.220521Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:07:15.203081Z","title":"Retrieval-augmented egocentric video captioning","venue":null,"work_id":"6c44e80f-cf52-487a-b598-b0f17b9ec8a5","year":2024},"citing_paper":{"arxiv_id":"2412.21080","last_updated":"2024-12-30T16:57:05Z","snapshot_observed_at":"2026-08-12T17:46:33.884595Z","submitted_at":"2024-12-30T16:57:05Z","title":"Vinci: A Real-time Embodied Smart Assistant based on Egocentric Vision-Language Model","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:14.693756Z"},"links":{"citing_paper":"/paper/2412.21080"},"observation_digest":"sha256:3d417566139ed58b0153355c401756b7e30b18139f9066b0315eeca373972780","observation_id":"60f48183-1dc4-4dc3-afd6-b972d1a6b482","resolution":{"observed_at":"2026-08-10T23:07:15.207403Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:07:15.189819Z","title":"Finebio: A fine-grained video dataset of biological experiments with hierarchical annotations","venue":null,"work_id":"98f55fb7-3e71-4cd9-acae-b08ffa364d55","year":2023},"citing_paper":{"arxiv_id":"2412.21080","last_updated":"2024-12-30T16:57:05Z","snapshot_observed_at":"2026-08-12T17:46:33.884595Z","submitted_at":"2024-12-30T16:57:05Z","title":"Vinci: A Real-time Embodied Smart Assistant based on Egocentric Vision-Language Model","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:14.697840Z"},"links":{"citing_paper":"/paper/2412.21080"},"observation_digest":"sha256:d4b032c9a10d020ec982d4cc777aa340d0f5e5c93d656553667a812dfc21b352","observation_id":"17f451e4-2bd5-44c9-b122-156c80b385b0","resolution":{"observed_at":"2026-08-10T23:07:15.194360Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:07:15.176380Z","title":"Interact before align: Leveraging cross-modal knowledge for domain adaptive action recognition","venue":null,"work_id":"7759642b-2749-4001-9880-cee2b1908c4c","year":2022},"citing_paper":{"arxiv_id":"2412.21080","last_updated":"2024-12-30T16:57:05Z","snapshot_observed_at":"2026-08-12T17:46:33.884595Z","submitted_at":"2024-12-30T16:57:05Z","title":"Vinci: A Real-time Embodied Smart Assistant based on Egocentric Vision-Language Model","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:14.702716Z"},"links":{"citing_paper":"/paper/2412.21080"},"observation_digest":"sha256:627eb898b48dce654a98ade5baf51f2a6a53fb976816546ca33b35317c906f59","observation_id":"751d0146-664a-4d0c-8e48-52cf0d3f0c64","resolution":{"observed_at":"2026-08-10T23:07:15.180905Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:07:15.162485Z","title":"Deco: Decomposition and reconstruction for compositional temporal grounding via coarse-to-fine contrastive ranking","venue":null,"work_id":"9352e39e-dac4-49b7-b874-9e351f516f92","year":2023},"citing_paper":{"arxiv_id":"2412.21080","last_updated":"2024-12-30T16:57:05Z","snapshot_observed_at":"2026-08-12T17:46:33.884595Z","submitted_at":"2024-12-30T16:57:05Z","title":"Vinci: A Real-time Embodied Smart Assistant based on Egocentric Vision-Language Model","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:14.707238Z"},"links":{"citing_paper":"/paper/2412.21080"},"observation_digest":"sha256:e30e90f7f9d27e9baeb8793bccf5fbb8b999a551442f24051812b28631596fc6","observation_id":"f6c3e92b-cf47-4dd9-9c3b-97c06c6c5c89","resolution":{"observed_at":"2026-08-10T23:07:15.166916Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:07:15.148232Z","title":"Basictad: an astounding rgb-only baseline for temporal action detection","venue":null,"work_id":"e2779f8a-fe66-4680-a44c-5a7eede28998","year":2023},"citing_paper":{"arxiv_id":"2412.21080","last_updated":"2024-12-30T16:57:05Z","snapshot_observed_at":"2026-08-12T17:46:33.884595Z","submitted_at":"2024-12-30T16:57:05Z","title":"Vinci: A Real-time Embodied Smart Assistant based on Egocentric Vision-Language Model","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:14.711279Z"},"links":{"citing_paper":"/paper/2412.21080"},"observation_digest":"sha256:90d82ac78ba7ce2f1f21b10fda0d875ea992150e8b2ab8a6551dcdf18c3cc9b0","observation_id":"6ad907d8-7b73-404d-8b38-99d84344bd5a","resolution":{"observed_at":"2026-08-10T23:07:15.153204Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:07:15.134792Z","title":"Flash-vstream: Memory- based real-time understanding for long video streams, 2024","venue":null,"work_id":"f1890a94-ef61-4265-8f3d-b2b38eab4cc7","year":2024},"citing_paper":{"arxiv_id":"2412.21080","last_updated":"2024-12-30T16:57:05Z","snapshot_observed_at":"2026-08-12T17:46:33.884595Z","submitted_at":"2024-12-30T16:57:05Z","title":"Vinci: A Real-time Embodied Smart Assistant based on Egocentric Vision-Language Model","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:14.715438Z"},"links":{"citing_paper":"/paper/2412.21080"},"observation_digest":"sha256:cc9ad0d6c99696824454da33b0253387d65aad3852d0e0ea14e4f0a9622164e1","observation_id":"c35436ff-01b6-4ef2-ac97-f289e8add419","resolution":{"observed_at":"2026-08-10T23:07:15.139248Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:07:15.120731Z","title":"Fine-grained egocentric hand-object segmentation: Dataset, model, and applications","venue":null,"work_id":"f149bf1b-d99f-4d66-8b11-4b3741fdacdf","year":2022},"citing_paper":{"arxiv_id":"2412.21080","last_updated":"2024-12-30T16:57:05Z","snapshot_observed_at":"2026-08-12T17:46:33.884595Z","submitted_at":"2024-12-30T16:57:05Z","title":"Vinci: A Real-time Embodied Smart Assistant based on Egocentric Vision-Language Model","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:14.719771Z"},"links":{"citing_paper":"/paper/2412.21080"},"observation_digest":"sha256:12adb87075f36e1c07c8c910eb7ce92169f4c1ef178790d560313697b37f5608","observation_id":"b81ca1b8-ad46-4f13-82ec-552fdac0b5e5","resolution":{"observed_at":"2026-08-10T23:07:15.125890Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:07:15.105494Z","title":"Masked video and body-worn imu autoencoder for egocentric action recognition","venue":null,"work_id":"dfb4c3e3-e8cd-4c03-a7de-368487b832cd","year":2024},"citing_paper":{"arxiv_id":"2412.21080","last_updated":"2024-12-30T16:57:05Z","snapshot_observed_at":"2026-08-12T17:46:33.884595Z","submitted_at":"2024-12-30T16:57:05Z","title":"Vinci: A Real-time Embodied Smart Assistant based on Egocentric Vision-Language Model","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:14.724292Z"},"links":{"citing_paper":"/paper/2412.21080"},"observation_digest":"sha256:fd978325d338e1681654a4494002da009c0b58072bcd28c30ee770c49655ade8","observation_id":"b52f9a23-813b-4b13-9d2d-4d2c24a6c2c6","resolution":{"observed_at":"2026-08-10T23:07:15.110023Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:07:15.090390Z","title":"Internlm-xcomposer2.5-omnilive: A comprehensive multimodal system for long-term streaming video and audio interactions, 2024","venue":null,"work_id":"f2efb975-9e64-47c6-8e26-5a5e56db02ec","year":2024},"citing_paper":{"arxiv_id":"2412.21080","last_updated":"2024-12-30T16:57:05Z","snapshot_observed_at":"2026-08-12T17:46:33.884595Z","submitted_at":"2024-12-30T16:57:05Z","title":"Vinci: A Real-time Embodied Smart Assistant based on Egocentric Vision-Language Model","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:14.728181Z"},"links":{"citing_paper":"/paper/2412.21080"},"observation_digest":"sha256:a112b3a58038dab04d49e83db62d8ec7cf86a4935e55117f41d1f61d2627dc56","observation_id":"a38889f8-ece3-444c-9287-1e18ec78ffa5","resolution":{"observed_at":"2026-08-10T23:07:15.095032Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:07:15.076240Z","title":"Ego- body: Human body shape and motion of interacting people from head-mounted devices","venue":null,"work_id":"2a4d7504-7e4b-4b1f-9c79-b3081a672eaf","year":2022},"citing_paper":{"arxiv_id":"2412.21080","last_updated":"2024-12-30T16:57:05Z","snapshot_observed_at":"2026-08-12T17:46:33.884595Z","submitted_at":"2024-12-30T16:57:05Z","title":"Vinci: A Real-time Embodied Smart Assistant based on Egocentric Vision-Language Model","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:14.732377Z"},"links":{"citing_paper":"/paper/2412.21080"},"observation_digest":"sha256:9cd1110ab6535e1df6245bd0b53794da8c92467f37c0ce84ba07e7f9daca2ee8","observation_id":"7a6bd842-ceb9-4c81-9175-3e6b937781aa","resolution":{"observed_at":"2026-08-10T23:07:15.080915Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16669","last_updated":"2023-09-28T17:59:50Z","snapshot_observed_at":"2026-08-13T10:02:51.321246Z","submitted_at":"2023-09-28T17:59:50Z","title":"Training a Large Video Model on a Single Machine in a Day","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16669","snapshot_observed_at":"2026-08-10T23:07:14.736293Z","title":"Training a large video model on a single machine in a day","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.21080","last_updated":"2024-12-30T16:57:05Z","snapshot_observed_at":"2026-08-12T17:46:33.884595Z","submitted_at":"2024-12-30T16:57:05Z","title":"Vinci: A Real-time Embodied Smart Assistant based on Egocentric Vision-Language Model","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:14.736293Z"},"links":{"cited_paper":"/paper/2309.16669","citing_paper":"/paper/2412.21080"},"observation_digest":"sha256:2f626b209fbd131f4d8c2930c17ddf8175bd38afd087c8ff6d9cd04a6372e895","observation_id":"a7309c89-6de1-4361-8b8b-09e82da33cdd","resolution":{"observed_at":"2026-08-10T23:07:14.736293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:07:15.060573Z","title":"Learning video representations from large language mod- els","venue":null,"work_id":"5d2e875a-5c3c-4c22-85c8-162f113ace9d","year":2023},"citing_paper":{"arxiv_id":"2412.21080","last_updated":"2024-12-30T16:57:05Z","snapshot_observed_at":"2026-08-12T17:46:33.884595Z","submitted_at":"2024-12-30T16:57:05Z","title":"Vinci: A Real-time Embodied Smart Assistant based on Egocentric Vision-Language Model","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:14.740359Z"},"links":{"citing_paper":"/paper/2412.21080"},"observation_digest":"sha256:e1e12f747aee8c7af9302252ef455cef1a7d0cb112ef84154318990f3c179e88","observation_id":"cbd5f695-acc0-43e6-993a-83801994edfc","resolution":{"observed_at":"2026-08-10T23:07:15.065933Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:07:15.046572Z","title":"Learning video representations from large language models","venue":null,"work_id":"e6c22175-33b1-4ca9-8606-9f6806723efc","year":null},"citing_paper":{"arxiv_id":"2412.21080","last_updated":"2024-12-30T16:57:05Z","snapshot_observed_at":"2026-08-12T17:46:33.884595Z","submitted_at":"2024-12-30T16:57:05Z","title":"Vinci: A Real-time Embodied Smart Assistant based on Egocentric Vision-Language Model","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:14.744403Z"},"links":{"citing_paper":"/paper/2412.21080"},"observation_digest":"sha256:be6794035466d37bca5da73e762aed90f6cd5436b801fa6850b1731fd128dc14","observation_id":"872ce457-d2de-463e-b4fc-1e5a2a4f3de8","resolution":{"observed_at":"2026-08-10T23:07:15.051092Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:07:15.029830Z","title":"Mrsn: Multi-relation support network for video action detec- tion","venue":null,"work_id":"2f70e350-eb6b-422b-aa69-0a59da14ce98","year":2023},"citing_paper":{"arxiv_id":"2412.21080","last_updated":"2024-12-30T16:57:05Z","snapshot_observed_at":"2026-08-12T17:46:33.884595Z","submitted_at":"2024-12-30T16:57:05Z","title":"Vinci: A Real-time Embodied Smart Assistant based on Egocentric Vision-Language Model","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:14.748483Z"},"links":{"citing_paper":"/paper/2412.21080"},"observation_digest":"sha256:6720bcfa6dc99e7a62b832a9d8ee25ecb66e4e713b678916f9f32b74ef5d271a","observation_id":"0fb7ad97-c9ee-46a7-afaa-4dbc2565cbac","resolution":{"observed_at":"2026-08-10T23:07:15.036512Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.21080","last_updated":"2024-12-30T16:57:05Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-12T17:46:33.884595Z","submitted_at":"2024-12-30T16:57:05Z","title":"Vinci: A Real-time Embodied Smart Assistant based on Egocentric Vision-Language Model"},"reference_resolution":{"displayed":97,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":41,"verified_exact":0,"verified_fuzzy":56},"total_outbound_references":97},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 97 of 97 outbound references and 7 inbound Pith citation observations for arXiv:2412.21080."}