{"as_of":"2026-08-09T09:48:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5a5def0f618e5ecdfa40a6626f4f521c5cbe36721673f0a0dd8ac23bf6af7ead","coverage":[{"denominator":35,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":35,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T14:08:30.800648Z","state":"measured"},{"denominator":35,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":35,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.26518/citation-record","integrity":"/paper/2607.26518/integrity","json":"/paper/2607.26518/citation-record.json","paper":"/paper/2607.26518"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-01T14:08:24.560604Z","title":"arXiv preprint arXiv:2303.08774 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.26518","last_updated":"2026-07-30T02:44:33Z","snapshot_observed_at":"2026-08-09T07:34:06.895256Z","submitted_at":"2026-07-29T06:33:11Z","title":"EgoSafe: A First-Person Mobile-Captured Benchmark for Visual Safety Understanding","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T14:08:24.560604Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2607.26518"},"observation_digest":"sha256:ccc305be4c6eea80cae7735d5774a8a99a65ef07fa688181d03f7941e8acb544","observation_id":"1238daf1-96d0-4aeb-96f4-8c0376afe560","resolution":{"observed_at":"2026-08-01T14:08:24.560604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-01T14:08:24.655179Z","title":"arXiv preprint arXiv:2308.12966 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.26518","last_updated":"2026-07-30T02:44:33Z","snapshot_observed_at":"2026-08-09T07:34:06.895256Z","submitted_at":"2026-07-29T06:33:11Z","title":"EgoSafe: A First-Person Mobile-Captured Benchmark for Visual Safety Understanding","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-01T14:08:24.655179Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2607.26518"},"observation_digest":"sha256:0332717d60e4f263e1888b54b02e685f981ca94984481d111634e44b4afa521b","observation_id":"c5ee56d7-3138-4926-9a51-7f1977ea3575","resolution":{"observed_at":"2026-08-01T14:08:24.655179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-01T14:08:24.857336Z","title":"arXiv preprint arXiv:2502.13923 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26518","last_updated":"2026-07-30T02:44:33Z","snapshot_observed_at":"2026-08-09T07:34:06.895256Z","submitted_at":"2026-07-29T06:33:11Z","title":"EgoSafe: A First-Person Mobile-Captured Benchmark for Visual Safety Understanding","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-01T14:08:24.857336Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2607.26518"},"observation_digest":"sha256:609b102d51700efe86d7cf8fdf177d0b25d72aafcaa82c4fa6d5603b5f355a4e","observation_id":"966b3c20-cf93-4245-a8e6-71b25a394364","resolution":{"observed_at":"2026-08-01T14:08:24.857336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13106","last_updated":"2025-06-03T03:33:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T18:59:46Z","title":"VideoLLaMA 3: Frontier Multimodal Foundation Models for Image and Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13106","snapshot_observed_at":"2026-08-01T14:08:25.013731Z","title":"arXiv preprint arXiv:2501.13106 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26518","last_updated":"2026-07-30T02:44:33Z","snapshot_observed_at":"2026-08-09T07:34:06.895256Z","submitted_at":"2026-07-29T06:33:11Z","title":"EgoSafe: A First-Person Mobile-Captured Benchmark for Visual Safety Understanding","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-01T14:08:25.013731Z"},"links":{"cited_paper":"/paper/2501.13106","citing_paper":"/paper/2607.26518"},"observation_digest":"sha256:1e087d2e573c55308775c07df37d2126a09cd098dbec7bdae2b9b3baa52d44cd","observation_id":"4af56fb8-eba6-484e-8cf3-df061d59a1da","resolution":{"observed_at":"2026-08-01T14:08:25.013731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:08:25.192667Z","title":"In: 2020 25th International Conference on Pattern Recognition (ICPR)","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2607.26518","last_updated":"2026-07-30T02:44:33Z","snapshot_observed_at":"2026-08-09T07:34:06.895256Z","submitted_at":"2026-07-29T06:33:11Z","title":"EgoSafe: A First-Person Mobile-Captured Benchmark for Visual Safety Understanding","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T14:08:25.192667Z"},"links":{"citing_paper":"/paper/2607.26518"},"observation_digest":"sha256:d77049346ed6a13bf5549ff4ddbac31d67e3c59509f1e9a1a8ddef33b0b41f19","observation_id":"fd793225-e6ef-455b-b183-eb0674d3f37d","resolution":{"observed_at":"2026-08-01T14:08:25.192667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07476","snapshot_observed_at":"2026-08-01T14:08:25.398866Z","title":"arXiv preprint arXiv:2406.07476 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.26518","last_updated":"2026-07-30T02:44:33Z","snapshot_observed_at":"2026-08-09T07:34:06.895256Z","submitted_at":"2026-07-29T06:33:11Z","title":"EgoSafe: A First-Person Mobile-Captured Benchmark for Visual Safety Understanding","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T14:08:25.398866Z"},"links":{"cited_paper":"/paper/2406.07476","citing_paper":"/paper/2607.26518"},"observation_digest":"sha256:f0f9bb7161d4e33d7680ae7befee7de3057af39f4d3e87cdb1f88a33c9a10cf0","observation_id":"3e3b9c5e-c3c7-4ded-bcac-f45658f130eb","resolution":{"observed_at":"2026-08-01T14:08:25.398866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:08:25.567192Z","title":"IEEE Transactions on Pattern Anal- ysis and Machine Intelligence43(11), 4125–4141 (2021)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.26518","last_updated":"2026-07-30T02:44:33Z","snapshot_observed_at":"2026-08-09T07:34:06.895256Z","submitted_at":"2026-07-29T06:33:11Z","title":"EgoSafe: A First-Person Mobile-Captured Benchmark for Visual Safety Understanding","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-01T14:08:25.567192Z"},"links":{"citing_paper":"/paper/2607.26518"},"observation_digest":"sha256:e809f559efce3fbde6bb1782a7eaaf40041298115856f50917f389b78a70050d","observation_id":"107ab560-8696-45ed-94ff-044ceaeebc2d","resolution":{"observed_at":"2026-08-01T14:08:25.567192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:08:25.734988Z","title":"In: Proceedings of the First Workshop on Comparative Performance Evaluation: From Rules to Language Models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26518","last_updated":"2026-07-30T02:44:33Z","snapshot_observed_at":"2026-08-09T07:34:06.895256Z","submitted_at":"2026-07-29T06:33:11Z","title":"EgoSafe: A First-Person Mobile-Captured Benchmark for Visual Safety Understanding","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-01T14:08:25.734988Z"},"links":{"citing_paper":"/paper/2607.26518"},"observation_digest":"sha256:cc5246f29ab5cbb6529a619fa7c460950ad02a642a1e5c1df899ed9a4bc1d171","observation_id":"076bc363-7d64-476d-9a14-c666586673a1","resolution":{"observed_at":"2026-08-01T14:08:25.734988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:08:25.882188Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.26518","last_updated":"2026-07-30T02:44:33Z","snapshot_observed_at":"2026-08-09T07:34:06.895256Z","submitted_at":"2026-07-29T06:33:11Z","title":"EgoSafe: A First-Person Mobile-Captured Benchmark for Visual Safety Understanding","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T14:08:25.882188Z"},"links":{"citing_paper":"/paper/2607.26518"},"observation_digest":"sha256:bb1fe7a44973baa81d2b37af5d153917a013dcc23d2fccca55961af54ffdb199","observation_id":"dd3678dd-72d2-47b7-a8a1-12eda15f297a","resolution":{"observed_at":"2026-08-01T14:08:25.882188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:08:26.194007Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.26518","last_updated":"2026-07-30T02:44:33Z","snapshot_observed_at":"2026-08-09T07:34:06.895256Z","submitted_at":"2026-07-29T06:33:11Z","title":"EgoSafe: A First-Person Mobile-Captured Benchmark for Visual Safety Understanding","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T14:08:26.194007Z"},"links":{"citing_paper":"/paper/2607.26518"},"observation_digest":"sha256:3c9156cefbad766690c59f826e705418c948fc3ad7a1ed9ed4ec6b4f9ce9c8e6","observation_id":"355421b6-cc3b-46ca-bb22-782bcd7a0ebc","resolution":{"observed_at":"2026-08-01T14:08:26.194007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:08:26.474096Z","title":"In: 7th International Conference on Learning Representations, ICLR 2019, New Orleans, LA, USA, May 6-9, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.26518","last_updated":"2026-07-30T02:44:33Z","snapshot_observed_at":"2026-08-09T07:34:06.895256Z","submitted_at":"2026-07-29T06:33:11Z","title":"EgoSafe: A First-Person Mobile-Captured Benchmark for Visual Safety Understanding","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T14:08:26.474096Z"},"links":{"citing_paper":"/paper/2607.26518"},"observation_digest":"sha256:7d196f50c7a9095866736e5fc6b71ba36b11dbb24cde20627768070b3442a0b5","observation_id":"4b042e78-d559-4684-b3f2-14a1974c6724","resolution":{"observed_at":"2026-08-01T14:08:26.474096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05372","last_updated":"2025-05-29T01:27:33Z","snapshot_observed_at":"2026-08-09T07:33:29.138496Z","submitted_at":"2025-05-29T01:27:33Z","title":"DVD: A Comprehensive Dataset for Advancing Violence Detection in Real-World Scenarios","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.05372","snapshot_observed_at":"2026-08-01T14:08:26.709687Z","title":"arXiv preprint arXiv:2506.05372 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26518","last_updated":"2026-07-30T02:44:33Z","snapshot_observed_at":"2026-08-09T07:34:06.895256Z","submitted_at":"2026-07-29T06:33:11Z","title":"EgoSafe: A First-Person Mobile-Captured Benchmark for Visual Safety Understanding","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-01T14:08:26.709687Z"},"links":{"cited_paper":"/paper/2506.05372","citing_paper":"/paper/2607.26518"},"observation_digest":"sha256:66e355aee456108eabae80a3193c0fe20925c5fff6454904dd0e55c5acbfd357","observation_id":"c85052ad-3a78-48d0-9fdd-0e2be3abff50","resolution":{"observed_at":"2026-08-01T14:08:26.709687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:08:26.870771Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) (June 2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.26518","last_updated":"2026-07-30T02:44:33Z","snapshot_observed_at":"2026-08-09T07:34:06.895256Z","submitted_at":"2026-07-29T06:33:11Z","title":"EgoSafe: A First-Person Mobile-Captured Benchmark for Visual Safety Understanding","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T14:08:26.870771Z"},"links":{"citing_paper":"/paper/2607.26518"},"observation_digest":"sha256:19c6a855dd02ee0f6fde37b4a5f30d96be7efb47ff02e61afed2b92f8a1d5adf","observation_id":"1601b9f8-cf4f-4edd-8f20-6d9d147efd5b","resolution":{"observed_at":"2026-08-01T14:08:26.870771Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:08:27.144138Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.26518","last_updated":"2026-07-30T02:44:33Z","snapshot_observed_at":"2026-08-09T07:34:06.895256Z","submitted_at":"2026-07-29T06:33:11Z","title":"EgoSafe: A First-Person Mobile-Captured Benchmark for Visual Safety Understanding","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T14:08:27.144138Z"},"links":{"citing_paper":"/paper/2607.26518"},"observation_digest":"sha256:65c31de60ce0581a9fa4aaf20621031a78d2e4a531f0b6e0f1b65f3b46274b17","observation_id":"9fa3b80e-61bc-445b-916c-fd8c11442806","resolution":{"observed_at":"2026-08-01T14:08:27.144138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10122","snapshot_observed_at":"2026-08-01T14:08:27.271392Z","title":"arXiv preprint arXiv:2311.10122 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.26518","last_updated":"2026-07-30T02:44:33Z","snapshot_observed_at":"2026-08-09T07:34:06.895256Z","submitted_at":"2026-07-29T06:33:11Z","title":"EgoSafe: A First-Person Mobile-Captured Benchmark for Visual Safety Understanding","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-01T14:08:27.271392Z"},"links":{"cited_paper":"/paper/2311.10122","citing_paper":"/paper/2607.26518"},"observation_digest":"sha256:adc04cf846ffea253ce53ed70c6f2099b8c100ade7b15ad1fba6854312a98905","observation_id":"6406b937-e5b1-48cf-9be5-41fadc9d541e","resolution":{"observed_at":"2026-08-01T14:08:27.271392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:08:27.405741Z","title":"In: Ku, L.W., Martins, A., Srikumar, V","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.26518","last_updated":"2026-07-30T02:44:33Z","snapshot_observed_at":"2026-08-09T07:34:06.895256Z","submitted_at":"2026-07-29T06:33:11Z","title":"EgoSafe: A First-Person Mobile-Captured Benchmark for Visual Safety Understanding","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T14:08:27.405741Z"},"links":{"citing_paper":"/paper/2607.26518"},"observation_digest":"sha256:e979729d38d902b30584f14371cb4eac1ec0f2ca4dc124f3795169737aa78c0b","observation_id":"9d118a28-ca90-4308-82f2-bc63c6c22e9d","resolution":{"observed_at":"2026-08-01T14:08:27.405741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:08:27.645005Z","title":"In: Proceedings of the 40th annual meeting of the Association for Computational Linguistics","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2607.26518","last_updated":"2026-07-30T02:44:33Z","snapshot_observed_at":"2026-08-09T07:34:06.895256Z","submitted_at":"2026-07-29T06:33:11Z","title":"EgoSafe: A First-Person Mobile-Captured Benchmark for Visual Safety Understanding","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-01T14:08:27.645005Z"},"links":{"citing_paper":"/paper/2607.26518"},"observation_digest":"sha256:77b8e3c8d5f91c280fe10a5cec39e391eba21c37a04c87d5a9fb09afe7714e09","observation_id":"36611968-9571-481b-8141-34487f7cbbd2","resolution":{"observed_at":"2026-08-01T14:08:27.645005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:08:28.014800Z","title":"Soft Computing24(15), 11007–11017 (2020)","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.26518","last_updated":"2026-07-30T02:44:33Z","snapshot_observed_at":"2026-08-09T07:34:06.895256Z","submitted_at":"2026-07-29T06:33:11Z","title":"EgoSafe: A First-Person Mobile-Captured Benchmark for Visual Safety Understanding","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T14:08:28.014800Z"},"links":{"citing_paper":"/paper/2607.26518"},"observation_digest":"sha256:ec1e438531720eb63329e17f9e72a791bfb053d4ad6a72a0579d82941b67ef0a","observation_id":"32affd18-9ea6-406c-abdc-338ff0ea617a","resolution":{"observed_at":"2026-08-01T14:08:28.014800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:08:28.101263Z","title":"Multimedia Tools and Applica- tions83(22), 62107–62158 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.26518","last_updated":"2026-07-30T02:44:33Z","snapshot_observed_at":"2026-08-09T07:34:06.895256Z","submitted_at":"2026-07-29T06:33:11Z","title":"EgoSafe: A First-Person Mobile-Captured Benchmark for Visual Safety Understanding","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T14:08:28.101263Z"},"links":{"citing_paper":"/paper/2607.26518"},"observation_digest":"sha256:6afb45169c3b082f7bfe45d670739ce4d21e9dbf15ef336dfc2bf9a3f7f2a9f5","observation_id":"1ec5ac7d-a3d1-43bf-8241-d7eb9da0accd","resolution":{"observed_at":"2026-08-01T14:08:28.101263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:08:28.208282Z","title":"In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR) (June 2018) EgoSafe 19","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.26518","last_updated":"2026-07-30T02:44:33Z","snapshot_observed_at":"2026-08-09T07:34:06.895256Z","submitted_at":"2026-07-29T06:33:11Z","title":"EgoSafe: A First-Person Mobile-Captured Benchmark for Visual Safety Understanding","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T14:08:28.208282Z"},"links":{"citing_paper":"/paper/2607.26518"},"observation_digest":"sha256:6254bb8fe40e4b495915bc8a53176ac297e45eede91ba0db6baa93a4787bbb9b","observation_id":"6f24fa02-669e-42da-b1b7-e6fe14e69d4b","resolution":{"observed_at":"2026-08-01T14:08:28.208282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-01T14:08:28.354148Z","title":"arXiv preprint arXiv:2312.11805 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.26518","last_updated":"2026-07-30T02:44:33Z","snapshot_observed_at":"2026-08-09T07:34:06.895256Z","submitted_at":"2026-07-29T06:33:11Z","title":"EgoSafe: A First-Person Mobile-Captured Benchmark for Visual Safety Understanding","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-01T14:08:28.354148Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2607.26518"},"observation_digest":"sha256:b50c782acaa779889550e6b49c75303cf2800c5c21dd1e4ec8e1ec1872ae7660","observation_id":"c8dea55e-e46c-4460-84cd-7104afeafac7","resolution":{"observed_at":"2026-08-01T14:08:28.354148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-01T14:08:28.540578Z","title":"arXiv preprint arXiv:2403.05530 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.26518","last_updated":"2026-07-30T02:44:33Z","snapshot_observed_at":"2026-08-09T07:34:06.895256Z","submitted_at":"2026-07-29T06:33:11Z","title":"EgoSafe: A First-Person Mobile-Captured Benchmark for Visual Safety Understanding","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-01T14:08:28.540578Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2607.26518"},"observation_digest":"sha256:55ebca618671701c37b40928310d564a0d8989020e00d4d54a0415fb9ea4ae65","observation_id":"e9d3524b-fee0-4c0d-bafa-b670e763960b","resolution":{"observed_at":"2026-08-01T14:08:28.540578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:08:28.725690Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26518","last_updated":"2026-07-30T02:44:33Z","snapshot_observed_at":"2026-08-09T07:34:06.895256Z","submitted_at":"2026-07-29T06:33:11Z","title":"EgoSafe: A First-Person Mobile-Captured Benchmark for Visual Safety Understanding","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-01T14:08:28.725690Z"},"links":{"citing_paper":"/paper/2607.26518"},"observation_digest":"sha256:7d25395a04265fba586c3009795ae264fa7c52505e91c754a0fec130e44fadf2","observation_id":"493aa63f-ad35-4f23-9a1f-73952c6478ae","resolution":{"observed_at":"2026-08-01T14:08:28.725690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:08:28.855112Z","title":"In: Proceedings of the IEEE conference on computer vision and pattern recognition","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.26518","last_updated":"2026-07-30T02:44:33Z","snapshot_observed_at":"2026-08-09T07:34:06.895256Z","submitted_at":"2026-07-29T06:33:11Z","title":"EgoSafe: A First-Person Mobile-Captured Benchmark for Visual Safety Understanding","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-01T14:08:28.855112Z"},"links":{"citing_paper":"/paper/2607.26518"},"observation_digest":"sha256:2b51f3c60d637542b76e4ac07825382d79a071bc531be4299599b25eb97d2435","observation_id":"43291a9f-e330-4fae-8b52-84c2df60345f","resolution":{"observed_at":"2026-08-01T14:08:28.855112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-01T14:08:29.039815Z","title":"arXiv preprint arXiv:2409.12191 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.26518","last_updated":"2026-07-30T02:44:33Z","snapshot_observed_at":"2026-08-09T07:34:06.895256Z","submitted_at":"2026-07-29T06:33:11Z","title":"EgoSafe: A First-Person Mobile-Captured Benchmark for Visual Safety Understanding","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-01T14:08:29.039815Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2607.26518"},"observation_digest":"sha256:551dfcb494e338e234b5f7fda15c3cf6bd4a3a3c14dbe36accedccbf92e2f245","observation_id":"5f0b5937-b160-48b0-bc2a-a1e94bbfca78","resolution":{"observed_at":"2026-08-01T14:08:29.039815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18265","last_updated":"2025-08-27T14:39:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-25T17:58:17Z","title":"InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.18265","snapshot_observed_at":"2026-08-01T14:08:29.150412Z","title":"arXiv preprint arXiv:2508.18265 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26518","last_updated":"2026-07-30T02:44:33Z","snapshot_observed_at":"2026-08-09T07:34:06.895256Z","submitted_at":"2026-07-29T06:33:11Z","title":"EgoSafe: A First-Person Mobile-Captured Benchmark for Visual Safety Understanding","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-01T14:08:29.150412Z"},"links":{"cited_paper":"/paper/2508.18265","citing_paper":"/paper/2607.26518"},"observation_digest":"sha256:7542f26664d633595dc7b70536f55a2f266e2f519d5dfe0b70ea0ab050da7a85","observation_id":"3a66ad8a-2a45-4741-8394-25dfa51c96f8","resolution":{"observed_at":"2026-08-01T14:08:29.150412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.08380","last_updated":"2024-11-13T07:05:40Z","snapshot_observed_at":"2026-07-06T19:49:34.518432Z","submitted_at":"2024-11-13T07:05:40Z","title":"EgoVid-5M: A Large-Scale Video-Action Dataset for Egocentric Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.08380","snapshot_observed_at":"2026-08-01T14:08:29.408596Z","title":"arXiv preprint arXiv:2411.08380 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.26518","last_updated":"2026-07-30T02:44:33Z","snapshot_observed_at":"2026-08-09T07:34:06.895256Z","submitted_at":"2026-07-29T06:33:11Z","title":"EgoSafe: A First-Person Mobile-Captured Benchmark for Visual Safety Understanding","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-01T14:08:29.408596Z"},"links":{"cited_paper":"/paper/2411.08380","citing_paper":"/paper/2607.26518"},"observation_digest":"sha256:2ffed127249a456e05f53ea9ea13a147a5dfc3c0172dc8b253e0adc8c813e3dd","observation_id":"3f261905-45cb-4fb0-b2d3-10ff1f52fe30","resolution":{"observed_at":"2026-08-01T14:08:29.408596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:08:29.612634Z","title":"In: European Conference on Computer Vision (ECCV) (2020)","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.26518","last_updated":"2026-07-30T02:44:33Z","snapshot_observed_at":"2026-08-09T07:34:06.895256Z","submitted_at":"2026-07-29T06:33:11Z","title":"EgoSafe: A First-Person Mobile-Captured Benchmark for Visual Safety Understanding","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-01T14:08:29.612634Z"},"links":{"citing_paper":"/paper/2607.26518"},"observation_digest":"sha256:395fccef1a7a7fafe09bcccbee1e7c58bf4431ca1ec3ee8a05ce5012ab6ffe36","observation_id":"2195768c-a2a3-46c9-bb03-4f9e0d50e3f4","resolution":{"observed_at":"2026-08-01T14:08:29.612634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:08:29.867639Z","title":"IEEE Transactions on Multimedia26, 8557–8568 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.26518","last_updated":"2026-07-30T02:44:33Z","snapshot_observed_at":"2026-08-09T07:34:06.895256Z","submitted_at":"2026-07-29T06:33:11Z","title":"EgoSafe: A First-Person Mobile-Captured Benchmark for Visual Safety Understanding","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-01T14:08:29.867639Z"},"links":{"citing_paper":"/paper/2607.26518"},"observation_digest":"sha256:7a9dee33e29fc174c94766709b51480368b8196dd67a5cfcd945399090c59506","observation_id":"cb1fa7f8-7e9d-4faa-a6ec-e1f7c1a10388","resolution":{"observed_at":"2026-08-01T14:08:29.867639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:08:29.965345Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.26518","last_updated":"2026-07-30T02:44:33Z","snapshot_observed_at":"2026-08-09T07:34:06.895256Z","submitted_at":"2026-07-29T06:33:11Z","title":"EgoSafe: A First-Person Mobile-Captured Benchmark for Visual Safety Understanding","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-01T14:08:29.965345Z"},"links":{"citing_paper":"/paper/2607.26518"},"observation_digest":"sha256:43d857e1c1d7bdad31c57dd7a0b595848010f1f814816a96cd43f9fb62fc5677","observation_id":"6b3eb700-223a-450f-ba72-9eb2d5a93b85","resolution":{"observed_at":"2026-08-01T14:08:29.965345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.06513","last_updated":"2022-08-22T14:37:16Z","snapshot_observed_at":"2026-08-04T16:35:39.908448Z","submitted_at":"2021-10-13T05:59:39Z","title":"Benchmarking the Robustness of Spatial-Temporal Models Against Corruptions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.06513","snapshot_observed_at":"2026-08-01T14:08:30.257012Z","title":"CoRRabs/2110.06513(2021)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.26518","last_updated":"2026-07-30T02:44:33Z","snapshot_observed_at":"2026-08-09T07:34:06.895256Z","submitted_at":"2026-07-29T06:33:11Z","title":"EgoSafe: A First-Person Mobile-Captured Benchmark for Visual Safety Understanding","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-01T14:08:30.257012Z"},"links":{"cited_paper":"/paper/2110.06513","citing_paper":"/paper/2607.26518"},"observation_digest":"sha256:ac078c3c4912e43193f838b858dca78c710f2581455729f4a5b4b37f28553074","observation_id":"17a34a6f-8fd3-46c6-8a05-67961826e038","resolution":{"observed_at":"2026-08-01T14:08:30.257012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:08:30.416011Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26518","last_updated":"2026-07-30T02:44:33Z","snapshot_observed_at":"2026-08-09T07:34:06.895256Z","submitted_at":"2026-07-29T06:33:11Z","title":"EgoSafe: A First-Person Mobile-Captured Benchmark for Visual Safety Understanding","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-01T14:08:30.416011Z"},"links":{"citing_paper":"/paper/2607.26518"},"observation_digest":"sha256:333579c290ca188d470a694769b99d168668470ef6a29e50f363b5cfbdf1f169","observation_id":"6af20450-3880-4bfe-8fdd-51bd3d9b54d0","resolution":{"observed_at":"2026-08-01T14:08:30.416011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02858","last_updated":"2023-10-25T06:23:31Z","snapshot_observed_at":"2026-07-06T15:38:39.712379Z","submitted_at":"2023-06-05T13:17:27Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02858","snapshot_observed_at":"2026-08-01T14:08:30.544061Z","title":"arXiv preprint arXiv:2306.02858 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.26518","last_updated":"2026-07-30T02:44:33Z","snapshot_observed_at":"2026-08-09T07:34:06.895256Z","submitted_at":"2026-07-29T06:33:11Z","title":"EgoSafe: A First-Person Mobile-Captured Benchmark for Visual Safety Understanding","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-01T14:08:30.544061Z"},"links":{"cited_paper":"/paper/2306.02858","citing_paper":"/paper/2607.26518"},"observation_digest":"sha256:4827b10416b033c67225fc2dd5b85b11f3f962b4ac80a303fca003566b0697ee","observation_id":"11a02e51-0662-40f4-92ad-3a969d6db804","resolution":{"observed_at":"2026-08-01T14:08:30.544061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:08:30.648617Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.26518","last_updated":"2026-07-30T02:44:33Z","snapshot_observed_at":"2026-08-09T07:34:06.895256Z","submitted_at":"2026-07-29T06:33:11Z","title":"EgoSafe: A First-Person Mobile-Captured Benchmark for Visual Safety Understanding","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-01T14:08:30.648617Z"},"links":{"citing_paper":"/paper/2607.26518"},"observation_digest":"sha256:aac9c2fba615eed5a2822da9b9e23227d93761866e9b7b18ea9c434ba6f6d58f","observation_id":"44e2df20-b144-4986-8c0f-970959fcf388","resolution":{"observed_at":"2026-08-01T14:08:30.648617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:08:30.800648Z","title":"In: Proceedings of the IEEE/CVF International Conference on Computer Vision (ICCV) (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.26518","last_updated":"2026-07-30T02:44:33Z","snapshot_observed_at":"2026-08-09T07:34:06.895256Z","submitted_at":"2026-07-29T06:33:11Z","title":"EgoSafe: A First-Person Mobile-Captured Benchmark for Visual Safety Understanding","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-01T14:08:30.800648Z"},"links":{"citing_paper":"/paper/2607.26518"},"observation_digest":"sha256:e7f707e1c446fe87bdc3ca02eec3bb09ff2230336594ede7427803f802185896","observation_id":"a4697c95-0698-472d-95c5-89e4f4302d38","resolution":{"observed_at":"2026-08-01T14:08:30.800648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.26518","last_updated":"2026-07-30T02:44:33Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T07:34:06.895256Z","submitted_at":"2026-07-29T06:33:11Z","title":"EgoSafe: A First-Person Mobile-Captured Benchmark for Visual Safety Understanding"},"reference_resolution":{"displayed":35,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":35,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":35},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 35 of 35 outbound references and 0 inbound Pith citation observations for arXiv:2607.26518."}