{"as_of":"2026-08-05T16:35:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:420dbcbc4e53d853fe26b16758fbeaccf2b5e69e5054e4755d193d1e18e5ae4d","coverage":[{"denominator":49,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":49,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-11T02:12:20.651111Z","state":"measured"},{"denominator":50,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":50,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T03:21:47.718375Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.07897","last_updated":"2026-05-08T15:40:40Z","snapshot_observed_at":"2026-07-06T23:20:15.696237Z","submitted_at":"2026-05-08T15:40:40Z","title":"Semantic-Aware Adaptive Visual Memory for Streaming Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.07897","snapshot_observed_at":"2026-08-04T03:21:47.718375Z","title":"M.; Cai, Y.; Yang, M.-H.; and Wang, Y","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28312","last_updated":"2026-08-01T16:00:11Z","snapshot_observed_at":"2026-08-05T16:16:58.139576Z","submitted_at":"2026-07-30T14:47:00Z","title":"ObjectStream: Latent Objects as Memory Anchors for Streaming Video Understanding","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-04T03:21:47.718375Z"},"links":{"cited_paper":"/paper/2605.07897","citing_paper":"/paper/2607.28312"},"observation_digest":"sha256:fec2aed83b8d7b437732f6dbe8b9572f0db8698c13576cddc50ce078773eabbf","observation_id":"113d77bf-03e9-452a-8d1b-4a14e641c4ac","resolution":{"observed_at":"2026-08-04T03:21:47.718375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2605.07897/citation-record","integrity":"/paper/2605.07897/integrity","json":"/paper/2605.07897/citation-record.json","paper":"/paper/2605.07897"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2502.13923","doi":"10.48550/arxiv.2502.13923","metadata_source":"pith","pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5-VL Technical Report","venue":"cs.CV","work_id":"69dffacb-bfe8-442d-be86-48624c60426f","year":2025},"citing_paper":{"arxiv_id":"2605.07897","last_updated":"2026-05-08T15:40:40Z","snapshot_observed_at":"2026-07-06T23:20:15.696237Z","submitted_at":"2026-05-08T15:40:40Z","title":"Semantic-Aware Adaptive Visual Memory for Streaming Video Understanding","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-11T02:12:20.651111Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2605.07897"},"observation_digest":"sha256:d73a98735ff79940ec9398e1b6dd0353947ae2b2a6dbddb726a99afd492a35ee","observation_id":"3ef130f4-3c4d-4368-a1d6-c2729db0baaf","resolution":{"observed_at":"2026-05-11T03:50:56.728343Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-12T05:19:13.082554+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T05:19:13.082554+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Token merging: Your ViT but faster","venue":null,"work_id":"9fce0e5b-2df7-4e95-9a3f-8e2643730474","year":2023},"citing_paper":{"arxiv_id":"2605.07897","last_updated":"2026-05-08T15:40:40Z","snapshot_observed_at":"2026-07-06T23:20:15.696237Z","submitted_at":"2026-05-08T15:40:40Z","title":"Semantic-Aware Adaptive Visual Memory for Streaming Video Understanding","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-11T02:12:20.651111Z"},"links":{"citing_paper":"/paper/2605.07897"},"observation_digest":"sha256:16333cef2748f07df4bf00a3ff8e7565e361202970c29853e0ee0cafa7946d0f","observation_id":"aca26757-b3c8-4ee5-85ca-89377c2e702f","resolution":{"observed_at":"2026-05-14T13:50:58.296353Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T00:34:23.589812Z","title":"Videollm-online: Online video large language model for streaming video","venue":null,"work_id":"0d337e44-da4f-48a9-abf6-5bf7cc7c395e","year":2024},"citing_paper":{"arxiv_id":"2605.07897","last_updated":"2026-05-08T15:40:40Z","snapshot_observed_at":"2026-07-06T23:20:15.696237Z","submitted_at":"2026-05-08T15:40:40Z","title":"Semantic-Aware Adaptive Visual Memory for Streaming Video Understanding","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-11T02:12:20.651111Z"},"links":{"citing_paper":"/paper/2605.07897"},"observation_digest":"sha256:09affbba23f6e2553e9020d43dada84c7920aa9a49839ea4fa0c3a48952ab5bf","observation_id":"11bb9116-a31f-4db5-9986-2dea5053d1e1","resolution":{"observed_at":"2026-05-14T13:50:58.282447Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"End-to-end autonomous driving: Challenges and frontiers.IEEE Transactions on Pattern Analysis and Machine Intelligence","venue":null,"work_id":"e06a309d-8049-404b-bd7f-18f4dc848abd","year":2024},"citing_paper":{"arxiv_id":"2605.07897","last_updated":"2026-05-08T15:40:40Z","snapshot_observed_at":"2026-07-06T23:20:15.696237Z","submitted_at":"2026-05-08T15:40:40Z","title":"Semantic-Aware Adaptive Visual Memory for Streaming Video Understanding","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-11T02:12:20.651111Z"},"links":{"citing_paper":"/paper/2605.07897"},"observation_digest":"sha256:f1c1afa1ecbd8c9c7668c646d7662185570318e14d9525aed54abecada06f50f","observation_id":"e39ad353-654d-49ad-8495-0f4fb42c4eea","resolution":{"observed_at":"2026-05-14T13:50:58.275673Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"How far are we to gpt-4v? closing the gap to commercial multimodal models with open-source suites.Science China Information Sciences, 67(12):220101","venue":null,"work_id":"d11e14a2-3976-4af5-bdfd-ad5f9b29d04a","year":2024},"citing_paper":{"arxiv_id":"2605.07897","last_updated":"2026-05-08T15:40:40Z","snapshot_observed_at":"2026-07-06T23:20:15.696237Z","submitted_at":"2026-05-08T15:40:40Z","title":"Semantic-Aware Adaptive Visual Memory for Streaming Video Understanding","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-11T02:12:20.651111Z"},"links":{"citing_paper":"/paper/2605.07897"},"observation_digest":"sha256:7fe302e16455bcc0b051d9b0a4457398096dfd64f9d9483d39fde6c019e10a97","observation_id":"67294575-ce6b-4214-b2d7-2e3d96f52576","resolution":{"observed_at":"2026-05-14T13:50:58.335451Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Streaming video question-answering with in-context video kv-cache retrieval","venue":null,"work_id":"3913aa4a-e18c-4083-9948-6a72e48dfb75","year":2025},"citing_paper":{"arxiv_id":"2605.07897","last_updated":"2026-05-08T15:40:40Z","snapshot_observed_at":"2026-07-06T23:20:15.696237Z","submitted_at":"2026-05-08T15:40:40Z","title":"Semantic-Aware Adaptive Visual Memory for Streaming Video Understanding","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-11T02:12:20.651111Z"},"links":{"citing_paper":"/paper/2605.07897"},"observation_digest":"sha256:da57061e81fe37a7b3d7db7f72b40fe1beb8006c9c405c0097bbda26e795646e","observation_id":"73cbad4a-5406-4008-a837-973b8350428e","resolution":{"observed_at":"2026-05-14T13:50:58.279141Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.04560","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Contextnav: Towards agentic multimodal in-context learning","venue":null,"work_id":"438b9680-f931-49a1-bf2f-5ec272d54879","year":2025},"citing_paper":{"arxiv_id":"2605.07897","last_updated":"2026-05-08T15:40:40Z","snapshot_observed_at":"2026-07-06T23:20:15.696237Z","submitted_at":"2026-05-08T15:40:40Z","title":"Semantic-Aware Adaptive Visual Memory for Streaming Video Understanding","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-11T02:12:20.651111Z"},"links":{"citing_paper":"/paper/2605.07897"},"observation_digest":"sha256:5f572829d309ecc613ba3973b5aabde9ec8e17d9f56acccf534790b0fca4ea17","observation_id":"5a0e7e1d-e4e0-4693-bc82-fd3ad1ff0c3b","resolution":{"observed_at":"2026-05-11T03:50:56.682389Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vispeak: Visual instruction feedback in streaming videos.ICCV","venue":null,"work_id":"ebe9ed03-e315-47f8-ae0d-cea7623f1bf7","year":2025},"citing_paper":{"arxiv_id":"2605.07897","last_updated":"2026-05-08T15:40:40Z","snapshot_observed_at":"2026-07-06T23:20:15.696237Z","submitted_at":"2026-05-08T15:40:40Z","title":"Semantic-Aware Adaptive Visual Memory for Streaming Video Understanding","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-11T02:12:20.651111Z"},"links":{"citing_paper":"/paper/2605.07897"},"observation_digest":"sha256:30be69b50529fad4602ec6731f289db733929f3a39fd663d193bd7c4ee6b7adb","observation_id":"c3c5ac3f-d520-4fac-bc78-2f09cf970c3a","resolution":{"observed_at":"2026-05-14T13:50:58.329770Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.24008","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T17:27:15.756495Z","title":"Framemind: Frame-interleaved chain-of-thought for video reasoning via reinforcement learning","venue":null,"work_id":"89e207e7-f80b-4dee-bee3-05fb8ca2e8d1","year":2025},"citing_paper":{"arxiv_id":"2605.07897","last_updated":"2026-05-08T15:40:40Z","snapshot_observed_at":"2026-07-06T23:20:15.696237Z","submitted_at":"2026-05-08T15:40:40Z","title":"Semantic-Aware Adaptive Visual Memory for Streaming Video Understanding","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-11T02:12:20.651111Z"},"links":{"citing_paper":"/paper/2605.07897"},"observation_digest":"sha256:b9704fe74d3d77c9074ccfe9f9c86a5df935e3551dbe8b4aa82d8ba66aeeead0","observation_id":"7c5c557c-67ee-4cfb-b736-c68cf4ec02c9","resolution":{"observed_at":"2026-05-11T03:50:56.358339Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Online video understanding: Ovbench and videochat-online","venue":null,"work_id":"bfedd154-a8ab-4ee2-8765-d4762e92ae46","year":2025},"citing_paper":{"arxiv_id":"2605.07897","last_updated":"2026-05-08T15:40:40Z","snapshot_observed_at":"2026-07-06T23:20:15.696237Z","submitted_at":"2026-05-08T15:40:40Z","title":"Semantic-Aware Adaptive Visual Memory for Streaming Video Understanding","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-11T02:12:20.651111Z"},"links":{"citing_paper":"/paper/2605.07897"},"observation_digest":"sha256:bbe37bc0acd775d505c310a744c79a3f4f369e66e819dfb6761608086b5cc9ee","observation_id":"08fafee2-43ab-4884-8e57-c6f90e5993d9","resolution":{"observed_at":"2026-05-14T13:50:58.321534Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":"2410.21276","doi":"10.1177/15248380231178756","metadata_source":"pith","pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPT-4o System Card","venue":"cs.CL","work_id":"f37bf1c7-4964-4e56-9762-d20da8d9009f","year":2024},"citing_paper":{"arxiv_id":"2605.07897","last_updated":"2026-05-08T15:40:40Z","snapshot_observed_at":"2026-07-06T23:20:15.696237Z","submitted_at":"2026-05-08T15:40:40Z","title":"Semantic-Aware Adaptive Visual Memory for Streaming Video Understanding","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-11T02:12:20.651111Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2605.07897"},"observation_digest":"sha256:0905611293256e1de41c8b18dc2d823aca0d97a38deecd87a785ee65d9d680c7","observation_id":"164185d6-5052-4626-a537-f2f29a40f0bd","resolution":{"observed_at":"2026-05-11T03:50:56.600709Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Colbert: Efficient and effective passage search via contextualized late interaction over bert","venue":null,"work_id":"7f6306ac-089a-4670-a6f8-27913b76d5ec","year":2020},"citing_paper":{"arxiv_id":"2605.07897","last_updated":"2026-05-08T15:40:40Z","snapshot_observed_at":"2026-07-06T23:20:15.696237Z","submitted_at":"2026-05-08T15:40:40Z","title":"Semantic-Aware Adaptive Visual Memory for Streaming Video Understanding","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-11T02:12:20.651111Z"},"links":{"citing_paper":"/paper/2605.07897"},"observation_digest":"sha256:42b41e4bcb06572ce12241947691c264551982121b47e63961396b6f449c9a20","observation_id":"856863e4-259a-41bf-a02b-b435c1916619","resolution":{"observed_at":"2026-05-14T13:50:58.293819Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Interaction methods for smart glasses: A survey.IEEE access, 6:28712–28732","venue":null,"work_id":"1bb0a04f-8198-47cd-bef7-96d5b763c2e9","year":2018},"citing_paper":{"arxiv_id":"2605.07897","last_updated":"2026-05-08T15:40:40Z","snapshot_observed_at":"2026-07-06T23:20:15.696237Z","submitted_at":"2026-05-08T15:40:40Z","title":"Semantic-Aware Adaptive Visual Memory for Streaming Video Understanding","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-11T02:12:20.651111Z"},"links":{"citing_paper":"/paper/2605.07897"},"observation_digest":"sha256:a3725654f50893f262dfa11ed01d7e28255026e97f08f8f1f8f879ec973a12a2","observation_id":"f7674042-f15d-49a9-988d-8babf5d5f3af","resolution":{"observed_at":"2026-05-14T13:50:58.310617Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":"2408.03326","doi":"10.48550/arxiv.2408.03326","metadata_source":"pith","pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","venue":"cs.CV","work_id":"f5f2452b-f2a9-49ac-b38d-c76e18cdfe49","year":2024},"citing_paper":{"arxiv_id":"2605.07897","last_updated":"2026-05-08T15:40:40Z","snapshot_observed_at":"2026-07-06T23:20:15.696237Z","submitted_at":"2026-05-08T15:40:40Z","title":"Semantic-Aware Adaptive Visual Memory for Streaming Video Understanding","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-11T02:12:20.651111Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2605.07897"},"observation_digest":"sha256:c35dff693936a69cfe369a0d2963d8d26876ec08cef027a3ff19fd64088bef80","observation_id":"12cfcf3d-8cf4-4513-bd55-77f4657c2a65","resolution":{"observed_at":"2026-05-11T03:50:56.660336Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.03628","last_updated":"2024-11-06T02:50:30Z","snapshot_observed_at":"2026-07-06T19:45:57.808548Z","submitted_at":"2024-11-06T02:50:30Z","title":"StreamingBench: Assessing the Gap for MLLMs to Achieve Streaming Video Understanding","version":1},"cited_work":{"arxiv_id":"2411.03628","doi":"10.48550/arxiv.2411.03628","metadata_source":"arxiv_reference","pith_arxiv_id":"2411.03628","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Streamingbench: Assessing the gap for mllms to achieve streaming video un- derstanding","venue":"arXiv (Cornell University)","work_id":"caec985b-dd2d-4dbb-9199-d147732de99a","year":2024},"citing_paper":{"arxiv_id":"2605.07897","last_updated":"2026-05-08T15:40:40Z","snapshot_observed_at":"2026-07-06T23:20:15.696237Z","submitted_at":"2026-05-08T15:40:40Z","title":"Semantic-Aware Adaptive Visual Memory for Streaming Video Understanding","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-11T02:12:20.651111Z"},"links":{"cited_paper":"/paper/2411.03628","citing_paper":"/paper/2605.07897"},"observation_digest":"sha256:d0ba65614bfbfed64adf86eb55b7a3cb4c9e8c6d8019945a3248bbf6852737e8","observation_id":"66471926-6853-4272-a1f4-7383aab5a4e5","resolution":{"observed_at":"2026-05-11T03:50:56.707856Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Aligning cyber space with physical world: A comprehensive survey on embodied ai.IEEE/ASME Transactions on Mechatronics","venue":null,"work_id":"abec8419-3efd-4d1c-abf2-c55890db016c","year":2025},"citing_paper":{"arxiv_id":"2605.07897","last_updated":"2026-05-08T15:40:40Z","snapshot_observed_at":"2026-07-06T23:20:15.696237Z","submitted_at":"2026-05-08T15:40:40Z","title":"Semantic-Aware Adaptive Visual Memory for Streaming Video Understanding","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-11T02:12:20.651111Z"},"links":{"citing_paper":"/paper/2605.07897"},"observation_digest":"sha256:23f0d603f883e179038d55c231bbcfdd7ea907ad5ae7065aed099bb8d9306746","observation_id":"930384d9-d9c0-4594-9ade-d05441dec74b","resolution":{"observed_at":"2026-05-14T13:50:58.304421Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.12938","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T17:07:12.890978Z","title":"Thinking in streaming video","venue":null,"work_id":"d76098fe-8c64-4d90-92e4-ce36c34c9ed6","year":2026},"citing_paper":{"arxiv_id":"2605.07897","last_updated":"2026-05-08T15:40:40Z","snapshot_observed_at":"2026-07-06T23:20:15.696237Z","submitted_at":"2026-05-08T15:40:40Z","title":"Semantic-Aware Adaptive Visual Memory for Streaming Video Understanding","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-11T02:12:20.651111Z"},"links":{"citing_paper":"/paper/2605.07897"},"observation_digest":"sha256:d44358d36407ef8298c2429900fcb98f1ea42e20461aa5540e4dd1624b53b6f4","observation_id":"2da1e5ae-2c09-4a3b-bac5-f7af9f1b4ce8","resolution":{"observed_at":"2026-05-11T03:50:56.723910Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Video-chatgpt: Towards detailed video understanding via large vision and language models","venue":null,"work_id":"9825992b-3381-4126-a699-062cc39ce1e9","year":2024},"citing_paper":{"arxiv_id":"2605.07897","last_updated":"2026-05-08T15:40:40Z","snapshot_observed_at":"2026-07-06T23:20:15.696237Z","submitted_at":"2026-05-08T15:40:40Z","title":"Semantic-Aware Adaptive Visual Memory for Streaming Video Understanding","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-11T02:12:20.651111Z"},"links":{"citing_paper":"/paper/2605.07897"},"observation_digest":"sha256:45f291f56c6b40782b8711751620a94c86610be7d83d5e7a3925fa60499b868c","observation_id":"33c38f6c-0c47-437a-a022-5ef812e39d04","resolution":{"observed_at":"2026-05-14T13:50:58.306839Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13334","last_updated":"2025-07-21T17:48:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-17T17:50:36Z","title":"A Survey of Context Engineering for Large Language Models","version":2},"cited_work":{"arxiv_id":"2507.13334","doi":"10.48550/arxiv.2507.13334","metadata_source":"pith","pith_arxiv_id":"2507.13334","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A Survey of Context Engineering for Large Language Models","venue":"cs.CL","work_id":"8936785a-a829-4d9c-b641-ee29311824e4","year":2025},"citing_paper":{"arxiv_id":"2605.07897","last_updated":"2026-05-08T15:40:40Z","snapshot_observed_at":"2026-07-06T23:20:15.696237Z","submitted_at":"2026-05-08T15:40:40Z","title":"Semantic-Aware Adaptive Visual Memory for Streaming Video Understanding","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-11T02:12:20.651111Z"},"links":{"cited_paper":"/paper/2507.13334","citing_paper":"/paper/2605.07897"},"observation_digest":"sha256:ad96f283c687703ea2556b0c51b4643efbfd9742bc181e09eb2e7747b93c21fe","observation_id":"834c531f-c251-499a-86cd-301799397b71","resolution":{"observed_at":"2026-05-13T20:58:45.795434Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.12906","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gated differentiable working memory for long-context language modeling","venue":null,"work_id":"e1f00cdd-300e-4354-9455-890521d85ff4","year":2026},"citing_paper":{"arxiv_id":"2605.07897","last_updated":"2026-05-08T15:40:40Z","snapshot_observed_at":"2026-07-06T23:20:15.696237Z","submitted_at":"2026-05-08T15:40:40Z","title":"Semantic-Aware Adaptive Visual Memory for Streaming Video Understanding","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-11T02:12:20.651111Z"},"links":{"citing_paper":"/paper/2605.07897"},"observation_digest":"sha256:5dd22ec2fed82b822bd469c6d97e7d6bb283b868f26f18678ee2f4946aaf3eb2","observation_id":"4077ec18-0598-48a5-97b2-22f5156a1595","resolution":{"observed_at":"2026-05-11T03:50:56.510940Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15269","last_updated":"2026-04-23T12:54:38Z","snapshot_observed_at":"2026-08-03T01:07:06.468931Z","submitted_at":"2025-05-21T08:47:15Z","title":"LiveVLM: Efficient Online Video Understanding via Streaming-Oriented KV Cache and Retrieval","version":2},"cited_work":{"arxiv_id":"2505.15269","doi":"10.48550/arxiv.2505.15269","metadata_source":"pith","pith_arxiv_id":"2505.15269","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"LiveVLM: Efficient Online Video Understanding via Streaming-Oriented KV Cache and Retrieval","venue":"cs.CV","work_id":"a00b4d7a-5adc-4855-89a1-5356dc946a85","year":2025},"citing_paper":{"arxiv_id":"2605.07897","last_updated":"2026-05-08T15:40:40Z","snapshot_observed_at":"2026-07-06T23:20:15.696237Z","submitted_at":"2026-05-08T15:40:40Z","title":"Semantic-Aware Adaptive Visual Memory for Streaming Video Understanding","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-11T02:12:20.651111Z"},"links":{"cited_paper":"/paper/2505.15269","citing_paper":"/paper/2605.07897"},"observation_digest":"sha256:7aa174e39c9fc61f6e952d9a644af28e5d1e3808a071d722f24a737c1007388b","observation_id":"4721a065-4802-484a-8aa8-555228acd816","resolution":{"observed_at":"2026-05-11T03:50:56.573338Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ovo-bench: How far is your video-llms from real-world online video understanding? InCVPR, pages 18902–18913","venue":null,"work_id":"4bccd7eb-29dc-4b6c-ab28-578f9b88084a","year":2025},"citing_paper":{"arxiv_id":"2605.07897","last_updated":"2026-05-08T15:40:40Z","snapshot_observed_at":"2026-07-06T23:20:15.696237Z","submitted_at":"2026-05-08T15:40:40Z","title":"Semantic-Aware Adaptive Visual Memory for Streaming Video Understanding","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-11T02:12:20.651111Z"},"links":{"citing_paper":"/paper/2605.07897"},"observation_digest":"sha256:6c49164776d8d030b2872189eb61180e1ca9e94c94c3aaf2a5e929e1f7f9e5aa","observation_id":"8a3a5fa0-23f5-438e-8bd8-5f15150b23e4","resolution":{"observed_at":"2026-05-14T13:50:58.337915Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Athresholdselectionmethodfromgray-levelhistograms.IEEETransactionsonSystems,Man,andCybernetics, 9(1):62–66","venue":null,"work_id":"cd77b15d-afd0-4709-b77a-18f2ee172e51","year":1979},"citing_paper":{"arxiv_id":"2605.07897","last_updated":"2026-05-08T15:40:40Z","snapshot_observed_at":"2026-07-06T23:20:15.696237Z","submitted_at":"2026-05-08T15:40:40Z","title":"Semantic-Aware Adaptive Visual Memory for Streaming Video Understanding","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-11T02:12:20.651111Z"},"links":{"citing_paper":"/paper/2605.07897"},"observation_digest":"sha256:b481710acaab2ae7a603e15aec00ea6142db7f276ba3148d7821126eb66c25df","observation_id":"394ee2b2-0a37-46b4-9afe-d094c66f3237","resolution":{"observed_at":"2026-05-14T13:50:58.288427Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Streaming long video understanding with large language models.NeurIPS, 37:119336–119360","venue":null,"work_id":"c263a154-7186-4b84-a8b4-af000f64f0be","year":2024},"citing_paper":{"arxiv_id":"2605.07897","last_updated":"2026-05-08T15:40:40Z","snapshot_observed_at":"2026-07-06T23:20:15.696237Z","submitted_at":"2026-05-08T15:40:40Z","title":"Semantic-Aware Adaptive Visual Memory for Streaming Video Understanding","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-11T02:12:20.651111Z"},"links":{"citing_paper":"/paper/2605.07897"},"observation_digest":"sha256:90a77c8612f4807698b6758f3e42124063cb0f90814a195d9eeff0f585744eef","observation_id":"cf0aef41-8c40-469c-8371-14da1d47333b","resolution":{"observed_at":"2026-05-14T13:50:58.285159Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dispider: Enabling video llms with active real-time interaction via disentangled perception, decision, and reaction","venue":null,"work_id":"e5368276-7cbb-40b2-82ac-82daf99c1d23","year":2025},"citing_paper":{"arxiv_id":"2605.07897","last_updated":"2026-05-08T15:40:40Z","snapshot_observed_at":"2026-07-06T23:20:15.696237Z","submitted_at":"2026-05-08T15:40:40Z","title":"Semantic-Aware Adaptive Visual Memory for Streaming Video Understanding","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-11T02:12:20.651111Z"},"links":{"citing_paper":"/paper/2605.07897"},"observation_digest":"sha256:2bbbc34a49f09bfbe5f36f067b1c5b7b23d13b4ee5b379f483c992603b850401","observation_id":"05bfd455-20aa-43be-ac4e-e18d0848ae8e","resolution":{"observed_at":"2026-05-14T13:50:58.319311Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Longvu: Spatiotemporal adaptive compression for long video-language understanding","venue":null,"work_id":"4966c069-8411-4d49-9f3c-8175dea6ec08","year":2025},"citing_paper":{"arxiv_id":"2605.07897","last_updated":"2026-05-08T15:40:40Z","snapshot_observed_at":"2026-07-06T23:20:15.696237Z","submitted_at":"2026-05-08T15:40:40Z","title":"Semantic-Aware Adaptive Visual Memory for Streaming Video Understanding","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-11T02:12:20.651111Z"},"links":{"citing_paper":"/paper/2605.07897"},"observation_digest":"sha256:ce0b3096463756decafbaebf601d44bc110782f3e085986a40e9b8da06ccb48f","observation_id":"a3b26720-147f-4ae9-a996-392e139c8168","resolution":{"observed_at":"2026-05-14T13:50:58.317309Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2604.02317","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T00:57:30.607600Z","title":"A Simple Baseline for Streaming Video Understanding","venue":null,"work_id":"fdb77ee7-ee71-4919-a8c0-0de4924801f5","year":2026},"citing_paper":{"arxiv_id":"2605.07897","last_updated":"2026-05-08T15:40:40Z","snapshot_observed_at":"2026-07-06T23:20:15.696237Z","submitted_at":"2026-05-08T15:40:40Z","title":"Semantic-Aware Adaptive Visual Memory for Streaming Video Understanding","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-11T02:12:20.651111Z"},"links":{"citing_paper":"/paper/2605.07897"},"observation_digest":"sha256:c6f008f281dd6399f58488f28335aa36cc59d06a85b31c8acc6b714616e3c23f","observation_id":"fdfbf315-9d46-48a6-b71f-c2678416f48d","resolution":{"observed_at":"2026-05-11T03:50:56.672127Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Video understanding with large language models: A survey.IEEE Transactions on Circuits and Systems for Video Technology","venue":null,"work_id":"450f52af-f193-4d2b-a7bf-2d140e96e311","year":2025},"citing_paper":{"arxiv_id":"2605.07897","last_updated":"2026-05-08T15:40:40Z","snapshot_observed_at":"2026-07-06T23:20:15.696237Z","submitted_at":"2026-05-08T15:40:40Z","title":"Semantic-Aware Adaptive Visual Memory for Streaming Video Understanding","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-11T02:12:20.651111Z"},"links":{"citing_paper":"/paper/2605.07897"},"observation_digest":"sha256:bfb74e8e9559972452890174660370aca81f38cb1c4b53f2d53c1ee7ef8ba5c4","observation_id":"e23b966d-1cb3-40e9-8228-87b3ede4758b","resolution":{"observed_at":"2026-05-14T13:50:58.327400Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":"2403.05530","doi":"10.48550/arxiv.2403.05530","metadata_source":"pith","pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","venue":"cs.CL","work_id":"80e3e977-f1bb-4c83-8d0c-1ab0a0c5c3f1","year":2024},"citing_paper":{"arxiv_id":"2605.07897","last_updated":"2026-05-08T15:40:40Z","snapshot_observed_at":"2026-07-06T23:20:15.696237Z","submitted_at":"2026-05-08T15:40:40Z","title":"Semantic-Aware Adaptive Visual Memory for Streaming Video Understanding","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-11T02:12:20.651111Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2605.07897"},"observation_digest":"sha256:542ec63e9f74ca48dc1b5e4726dde004f8daeeb291830bbac8c3f5238272012d","observation_id":"f2dbf2c8-d2ff-4443-b3ef-e4526cd558b5","resolution":{"observed_at":"2026-05-11T03:50:56.640450Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-02T03:08:14.426583+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-02T03:08:14.426583+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Streambridge: Turning your offline video large language model into a proactive streaming assistant.NeurIPS","venue":null,"work_id":"dad99ce3-7d70-4112-8a24-881394242318","year":2025},"citing_paper":{"arxiv_id":"2605.07897","last_updated":"2026-05-08T15:40:40Z","snapshot_observed_at":"2026-07-06T23:20:15.696237Z","submitted_at":"2026-05-08T15:40:40Z","title":"Semantic-Aware Adaptive Visual Memory for Streaming Video Understanding","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-11T02:12:20.651111Z"},"links":{"citing_paper":"/paper/2605.07897"},"observation_digest":"sha256:e5aaa7042aa9f99a5c2b0f272189ca9ec317f24f34ba125f4320f10eb89e1f7a","observation_id":"214a7323-1d43-4b65-a7c7-11d81a1ec7cc","resolution":{"observed_at":"2026-05-14T13:50:58.301870Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14407","last_updated":"2023-04-29T03:48:26Z","snapshot_observed_at":"2026-07-06T15:20:53.397829Z","submitted_at":"2023-04-27T17:59:58Z","title":"ChatVideo: A Tracklet-centric Multimodal and Versatile Video Understanding System","version":2},"cited_work":{"arxiv_id":"2304.14407","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2304.14407","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Chatvideo: A tracklet-centric multimodal and versatile video understanding system","venue":null,"work_id":"bd186832-fce9-4e7a-845b-19a5d5673de2","year":2023},"citing_paper":{"arxiv_id":"2605.07897","last_updated":"2026-05-08T15:40:40Z","snapshot_observed_at":"2026-07-06T23:20:15.696237Z","submitted_at":"2026-05-08T15:40:40Z","title":"Semantic-Aware Adaptive Visual Memory for Streaming Video Understanding","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-11T02:12:20.651111Z"},"links":{"cited_paper":"/paper/2304.14407","citing_paper":"/paper/2605.07897"},"observation_digest":"sha256:afabcc01b2a3734de5b4c6fd668540fca285cbf3f6a9b06794f6a74623772f1d","observation_id":"46f6a05a-b353-4bc2-8862-e30fd90d321a","resolution":{"observed_at":"2026-05-11T03:50:56.473686Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07574","last_updated":"2023-11-29T15:37:24Z","snapshot_observed_at":"2026-07-06T16:46:57.403995Z","submitted_at":"2023-11-13T18:59:31Z","title":"To See is to Believe: Prompting GPT-4V for Better Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":"2311.07574","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.07574","snapshot_observed_at":"2026-07-10T17:07:25.768424Z","title":"To see is to believe: Prompting gpt-4v for better visual instruction tuning","venue":"cs.CV","work_id":"b73c6ce2-f994-4605-9578-597e13cb9ae7","year":2023},"citing_paper":{"arxiv_id":"2605.07897","last_updated":"2026-05-08T15:40:40Z","snapshot_observed_at":"2026-07-06T23:20:15.696237Z","submitted_at":"2026-05-08T15:40:40Z","title":"Semantic-Aware Adaptive Visual Memory for Streaming Video Understanding","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-11T02:12:20.651111Z"},"links":{"cited_paper":"/paper/2311.07574","citing_paper":"/paper/2605.07897"},"observation_digest":"sha256:db0bdc97d5b194ba602037aa6f7099f661c51427464180ec2f4a456de21ed741","observation_id":"5ce4d7eb-816a-44b9-acb1-7698013bf443","resolution":{"observed_at":"2026-05-11T03:50:56.484333Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":"2409.12191","doi":"10.48550/arxiv.2409.12191","metadata_source":"pith","pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","venue":"cs.CV","work_id":"8abcfe4f-e0fb-44b7-9123-448fac95f90a","year":2024},"citing_paper":{"arxiv_id":"2605.07897","last_updated":"2026-05-08T15:40:40Z","snapshot_observed_at":"2026-07-06T23:20:15.696237Z","submitted_at":"2026-05-08T15:40:40Z","title":"Semantic-Aware Adaptive Visual Memory for Streaming Video Understanding","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-11T02:12:20.651111Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2605.07897"},"observation_digest":"sha256:55922001f3fcedae29577a800e2b86f3750936e302900a6a6d0103dd638a413b","observation_id":"c2a8e64d-bb3c-445d-94b8-46bc820064af","resolution":{"observed_at":"2026-05-11T03:50:56.415498Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-11T02:19:33.884263+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T02:19:33.884263+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12386","last_updated":"2025-07-13T18:57:17Z","snapshot_observed_at":"2026-08-05T00:52:07.112592Z","submitted_at":"2025-01-21T18:59:00Z","title":"InternVideo2.5: Empowering Video MLLMs with Long and Rich Context Modeling","version":3},"cited_work":{"arxiv_id":"2501.12386","doi":"10.48550/arxiv.2501.12386","metadata_source":"pith","pith_arxiv_id":"2501.12386","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"InternVideo2.5: Empowering Video MLLMs with Long and Rich Context Modeling","venue":"cs.CV","work_id":"5801b83f-d5f4-4020-bad2-4bc47f71fe7d","year":2025},"citing_paper":{"arxiv_id":"2605.07897","last_updated":"2026-05-08T15:40:40Z","snapshot_observed_at":"2026-07-06T23:20:15.696237Z","submitted_at":"2026-05-08T15:40:40Z","title":"Semantic-Aware Adaptive Visual Memory for Streaming Video Understanding","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-11T02:12:20.651111Z"},"links":{"cited_paper":"/paper/2501.12386","citing_paper":"/paper/2605.07897"},"observation_digest":"sha256:cd4d07a4bdf6087e17cd2899dc97f5a9055ad7f448993c3584c879650e102309","observation_id":"f258556c-d103-4168-afd5-85ef3680fb2f","resolution":{"observed_at":"2026-05-17T02:52:20.835573Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.00181","last_updated":"2026-04-14T16:44:13Z","snapshot_observed_at":"2026-07-06T22:43:50.689500Z","submitted_at":"2026-01-30T04:45:43Z","title":"CamReasoner: Reinforcing Camera Movement Understanding via Structured Spatial Reasoning","version":3},"cited_work":{"arxiv_id":"2602.00181","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.00181","snapshot_observed_at":"2026-07-04T17:40:00.889429Z","title":"CamReasoner: Reinforcing Camera Movement Understanding via Structured Spatial Reasoning","venue":"cs.CV","work_id":"dc4f2508-790c-49af-834e-d524a67beda6","year":2026},"citing_paper":{"arxiv_id":"2605.07897","last_updated":"2026-05-08T15:40:40Z","snapshot_observed_at":"2026-07-06T23:20:15.696237Z","submitted_at":"2026-05-08T15:40:40Z","title":"Semantic-Aware Adaptive Visual Memory for Streaming Video Understanding","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-11T02:12:20.651111Z"},"links":{"cited_paper":"/paper/2602.00181","citing_paper":"/paper/2605.07897"},"observation_digest":"sha256:9c5918a554b3eba2e0140c5fd98c2b685b2f1d17aa11b551666862a97728e9e9","observation_id":"049a96ef-ffc7-4c3a-82ae-51cae100a626","resolution":{"observed_at":"2026-05-11T03:50:56.493339Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Longvideobench: A benchmark for long-context interleaved video-language understanding.NeurIPS","venue":null,"work_id":"c105c6d3-349a-4a3a-b7cb-308edb774bbc","year":2024},"citing_paper":{"arxiv_id":"2605.07897","last_updated":"2026-05-08T15:40:40Z","snapshot_observed_at":"2026-07-06T23:20:15.696237Z","submitted_at":"2026-05-08T15:40:40Z","title":"Semantic-Aware Adaptive Visual Memory for Streaming Video Understanding","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-11T02:12:20.651111Z"},"links":{"citing_paper":"/paper/2605.07897"},"observation_digest":"sha256:6990a1d2af4609bbe0502c79ad55fa34c526bbd5a30af1d1a045a79ef226a2f1","observation_id":"a1a9b116-c700-434b-bd40-d91c97c3ea38","resolution":{"observed_at":"2026-05-14T13:50:58.313099Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.02096","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T20:00:08.216260Z","title":"Fluxmem: Adaptive hierarchical memory for streaming video understanding","venue":null,"work_id":"b772bceb-41f1-4390-a2bb-e406c445262d","year":2026},"citing_paper":{"arxiv_id":"2605.07897","last_updated":"2026-05-08T15:40:40Z","snapshot_observed_at":"2026-07-06T23:20:15.696237Z","submitted_at":"2026-05-08T15:40:40Z","title":"Semantic-Aware Adaptive Visual Memory for Streaming Video Understanding","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-11T02:12:20.651111Z"},"links":{"citing_paper":"/paper/2605.07897"},"observation_digest":"sha256:76749566d3214dde40411efbcd9ac514b132ddb10569ad1ecb5c47b700678bb8","observation_id":"ca0e2e08-160f-4b92-ae6b-17df6761d35d","resolution":{"observed_at":"2026-05-11T03:50:56.434561Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.09608","last_updated":"2025-10-10T17:59:58Z","snapshot_observed_at":"2026-07-06T22:32:22.953630Z","submitted_at":"2025-10-10T17:59:58Z","title":"StreamingVLM: Real-Time Understanding for Infinite Video Streams","version":1},"cited_work":{"arxiv_id":"2510.09608","doi":"10.48550/arxiv.2510.09608","metadata_source":"pith","pith_arxiv_id":"2510.09608","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"StreamingVLM: Real-Time Understanding for Infinite Video Streams","venue":"cs.CV","work_id":"e6785f4f-90d8-45ab-8e34-1a406ea2db88","year":2025},"citing_paper":{"arxiv_id":"2605.07897","last_updated":"2026-05-08T15:40:40Z","snapshot_observed_at":"2026-07-06T23:20:15.696237Z","submitted_at":"2026-05-08T15:40:40Z","title":"Semantic-Aware Adaptive Visual Memory for Streaming Video Understanding","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-11T02:12:20.651111Z"},"links":{"cited_paper":"/paper/2510.09608","citing_paper":"/paper/2605.07897"},"observation_digest":"sha256:b733ae925625e01aaeb47ac0e6fde3b9cfd40a7ac9845b9e28b7839929219adb","observation_id":"ca912523-693d-4cc0-bbc8-1a4248e47317","resolution":{"observed_at":"2026-05-17T11:51:33.451476Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.15717","last_updated":"2025-08-21T16:56:29Z","snapshot_observed_at":"2026-08-04T15:51:47.648176Z","submitted_at":"2025-08-21T16:56:29Z","title":"StreamMem: Query-Agnostic KV Cache Memory for Streaming Video Understanding","version":1},"cited_work":{"arxiv_id":"2508.15717","doi":"10.48550/arxiv.2508.15717","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.15717","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Streammem: Query-agnostic kv cache memory for stream- ing video understanding.arXiv preprint arXiv:2508.15717","venue":"ArXiv.org","work_id":"752bf839-d545-4378-a68d-4a958ba10cee","year":2025},"citing_paper":{"arxiv_id":"2605.07897","last_updated":"2026-05-08T15:40:40Z","snapshot_observed_at":"2026-07-06T23:20:15.696237Z","submitted_at":"2026-05-08T15:40:40Z","title":"Semantic-Aware Adaptive Visual Memory for Streaming Video Understanding","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-11T02:12:20.651111Z"},"links":{"cited_paper":"/paper/2508.15717","citing_paper":"/paper/2605.07897"},"observation_digest":"sha256:59d71961b0408f93021c06c06befb392707c8f191bbc823160a1bb99ac7f1758","observation_id":"4ccd50be-7e92-49ec-9989-e43b071e86f1","resolution":{"observed_at":"2026-05-11T03:50:56.370849Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Timechat-online: 80% visual tokens are naturally redundant in streaming videos","venue":null,"work_id":"57a60492-546c-49ef-9559-5fc5f53fb45e","year":2025},"citing_paper":{"arxiv_id":"2605.07897","last_updated":"2026-05-08T15:40:40Z","snapshot_observed_at":"2026-07-06T23:20:15.696237Z","submitted_at":"2026-05-08T15:40:40Z","title":"Semantic-Aware Adaptive Visual Memory for Streaming Video Understanding","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-11T02:12:20.651111Z"},"links":{"citing_paper":"/paper/2605.07897"},"observation_digest":"sha256:99beed62df244d4c4f47868bbbbc6def3c6ba3ff13dd45366e115d50953d1ef5","observation_id":"71c3f810-d55d-475c-8b6d-829ad8fbdb2f","resolution":{"observed_at":"2026-05-14T13:50:58.324135Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Streamforest: Efficient online video understanding with persistent event memory.NeurIPS","venue":null,"work_id":"9d76237f-90b4-4ccb-9f91-7fdb6a464c6c","year":2025},"citing_paper":{"arxiv_id":"2605.07897","last_updated":"2026-05-08T15:40:40Z","snapshot_observed_at":"2026-07-06T23:20:15.696237Z","submitted_at":"2026-05-08T15:40:40Z","title":"Semantic-Aware Adaptive Visual Memory for Streaming Video Understanding","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-11T02:12:20.651111Z"},"links":{"citing_paper":"/paper/2605.07897"},"observation_digest":"sha256:897beca759c174c9ea2dfa08b5ef9037a25b3b954889de8dbea8b3f77a98f695","observation_id":"7972e66d-952c-44ae-879d-643026da7ba4","resolution":{"observed_at":"2026-05-14T13:50:58.315244Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02858","last_updated":"2023-10-25T06:23:31Z","snapshot_observed_at":"2026-07-06T15:38:39.712379Z","submitted_at":"2023-06-05T13:17:27Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","version":4},"cited_work":{"arxiv_id":"2306.02858","doi":null,"metadata_source":"pith","pith_arxiv_id":"2306.02858","snapshot_observed_at":"2026-07-04T16:29:57.761121Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","venue":"cs.CL","work_id":"555cf04a-49a7-44b8-9019-a83ce85ace95","year":2023},"citing_paper":{"arxiv_id":"2605.07897","last_updated":"2026-05-08T15:40:40Z","snapshot_observed_at":"2026-07-06T23:20:15.696237Z","submitted_at":"2026-05-08T15:40:40Z","title":"Semantic-Aware Adaptive Visual Memory for Streaming Video Understanding","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-11T02:12:20.651111Z"},"links":{"cited_paper":"/paper/2306.02858","citing_paper":"/paper/2605.07897"},"observation_digest":"sha256:0bd8f100bbdc088358b8e053017b711f8ede4e73ac3e2dc9bfcae2ee716a18b1","observation_id":"75411568-414b-4639-92f5-0aef2823a9bd","resolution":{"observed_at":"2026-05-13T15:02:01.218694Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Flash-vstream: Memory-based real-time understanding for long video streams","venue":null,"work_id":"869d0768-d043-4f76-96cb-e0c285dce49e","year":2025},"citing_paper":{"arxiv_id":"2605.07897","last_updated":"2026-05-08T15:40:40Z","snapshot_observed_at":"2026-07-06T23:20:15.696237Z","submitted_at":"2026-05-08T15:40:40Z","title":"Semantic-Aware Adaptive Visual Memory for Streaming Video Understanding","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-11T02:12:20.651111Z"},"links":{"citing_paper":"/paper/2605.07897"},"observation_digest":"sha256:e396b07b92c90581b49eb934e2ad66191093665295b07af7e8458e8f76e1eb6a","observation_id":"ed007fe1-729a-4b8d-83c9-ede42513274c","resolution":{"observed_at":"2026-05-14T13:50:58.332328Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.14724","last_updated":"2026-05-07T12:10:26Z","snapshot_observed_at":"2026-08-05T03:02:47.238051Z","submitted_at":"2026-01-21T07:26:15Z","title":"HERMES: KV Cache as Hierarchical Memory for Efficient Streaming Video Understanding","version":4},"cited_work":{"arxiv_id":"2601.14724","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.14724","snapshot_observed_at":"2026-07-04T12:09:48.861966Z","title":"HERMES: KV Cache as Hierarchical Memory for Efficient Streaming Video Understanding","venue":"cs.CV","work_id":"c081a4c3-1313-4b9c-91eb-903564249448","year":2026},"citing_paper":{"arxiv_id":"2605.07897","last_updated":"2026-05-08T15:40:40Z","snapshot_observed_at":"2026-07-06T23:20:15.696237Z","submitted_at":"2026-05-08T15:40:40Z","title":"Semantic-Aware Adaptive Visual Memory for Streaming Video Understanding","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-11T02:12:20.651111Z"},"links":{"cited_paper":"/paper/2601.14724","citing_paper":"/paper/2605.07897"},"observation_digest":"sha256:9ea13ba94090950b55e1beba2e836d4193c8eebfd473227d52ab8a30fe1cca46","observation_id":"9888cebf-3702-4571-b03c-8ec4b3f3ee2c","resolution":{"observed_at":"2026-05-11T03:50:56.380773Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-07-06T18:36:12.298104Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":"2406.16852","doi":"10.48550/arxiv.2406.16852","metadata_source":"pith","pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Long Context Transfer from Language to Vision","venue":"cs.CV","work_id":"52f1b946-568f-4819-9d8a-a87296f8852d","year":2024},"citing_paper":{"arxiv_id":"2605.07897","last_updated":"2026-05-08T15:40:40Z","snapshot_observed_at":"2026-07-06T23:20:15.696237Z","submitted_at":"2026-05-08T15:40:40Z","title":"Semantic-Aware Adaptive Visual Memory for Streaming Video Understanding","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-11T02:12:20.651111Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2605.07897"},"observation_digest":"sha256:64f09c53e8b07cfdcf30caeee14c0a38aee58d66b2fc92a2397e4bb7f3103436","observation_id":"b1dfc6ce-be28-46e3-aaa0-58a0929a12f8","resolution":{"observed_at":"2026-05-12T07:08:36.726593Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02713","last_updated":"2025-08-01T16:40:14Z","snapshot_observed_at":"2026-08-02T12:24:31.329178Z","submitted_at":"2024-10-03T17:36:49Z","title":"LLaVA-Video: Video Instruction Tuning With Synthetic Data","version":3},"cited_work":{"arxiv_id":"2410.02713","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.02713","snapshot_observed_at":"2026-07-09T21:36:34.348434Z","title":"LLaVA-Video: Video Instruction Tuning With Synthetic Data","venue":"cs.CV","work_id":"e598f516-d992-449a-ab6d-6c788b3a1d7b","year":2024},"citing_paper":{"arxiv_id":"2605.07897","last_updated":"2026-05-08T15:40:40Z","snapshot_observed_at":"2026-07-06T23:20:15.696237Z","submitted_at":"2026-05-08T15:40:40Z","title":"Semantic-Aware Adaptive Visual Memory for Streaming Video Understanding","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-11T02:12:20.651111Z"},"links":{"cited_paper":"/paper/2410.02713","citing_paper":"/paper/2605.07897"},"observation_digest":"sha256:5f6ffd99d64025c2883aadb3f483bb9b0c7982cdd58581d659ef38bf3a2b8d03","observation_id":"02b79e42-e07e-4354-8171-c48e8b5cede1","resolution":{"observed_at":"2026-05-11T03:50:56.454106Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.22142","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Weavetime: Stream from earlier frames into emergent memory in videollms","venue":null,"work_id":"b8d17304-7e55-4249-b5bd-72784bb7c1ef","year":2026},"citing_paper":{"arxiv_id":"2605.07897","last_updated":"2026-05-08T15:40:40Z","snapshot_observed_at":"2026-07-06T23:20:15.696237Z","submitted_at":"2026-05-08T15:40:40Z","title":"Semantic-Aware Adaptive Visual Memory for Streaming Video Understanding","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-11T02:12:20.651111Z"},"links":{"citing_paper":"/paper/2605.07897"},"observation_digest":"sha256:826a99c23b1b9695b05e21041a914a384d6e67f6f3b7af6e0a9eee397bf28169","observation_id":"8c780156-d464-416c-b990-d3138c9315e9","resolution":{"observed_at":"2026-05-11T03:50:56.530833Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Whatobjectsarevisible?","venue":null,"work_id":"cdf572e5-95cd-4753-81e0-630de0e1d385","year":null},"citing_paper":{"arxiv_id":"2605.07897","last_updated":"2026-05-08T15:40:40Z","snapshot_observed_at":"2026-07-06T23:20:15.696237Z","submitted_at":"2026-05-08T15:40:40Z","title":"Semantic-Aware Adaptive Visual Memory for Streaming Video Understanding","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-11T02:12:20.651111Z"},"links":{"citing_paper":"/paper/2605.07897"},"observation_digest":"sha256:b5e29131e299a27455567eb85624b195c49429d14d621774fe68ba119384cc79","observation_id":"4d6215a8-9efa-4e93-b82e-05d7f8b4d6ec","resolution":{"observed_at":"2026-05-14T13:50:58.298959Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"What objects are visible in the scene ?","venue":null,"work_id":"cf60e847-ea56-4e2a-afef-9a8ef4c17076","year":null},"citing_paper":{"arxiv_id":"2605.07897","last_updated":"2026-05-08T15:40:40Z","snapshot_observed_at":"2026-07-06T23:20:15.696237Z","submitted_at":"2026-05-08T15:40:40Z","title":"Semantic-Aware Adaptive Visual Memory for Streaming Video Understanding","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-11T02:12:20.651111Z"},"links":{"citing_paper":"/paper/2605.07897"},"observation_digest":"sha256:410eb930b28cd01e8814d9c074bfb81573e3046a0eec19a86837509a7f934d62","observation_id":"22a250f7-bf45-45ab-bbd4-efe61ed1d5f8","resolution":{"observed_at":"2026-05-14T13:50:58.291504Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.07897","last_updated":"2026-05-08T15:40:40Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T23:20:15.696237Z","submitted_at":"2026-05-08T15:40:40Z","title":"Semantic-Aware Adaptive Visual Memory for Streaming Video Understanding"},"reference_resolution":{"displayed":49,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":25,"verified_fuzzy":24},"total_outbound_references":49},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 49 of 49 outbound references and 1 inbound Pith citation observation for arXiv:2605.07897."}