{"as_of":"2026-08-21T07:50:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d0d06a97cce0f1a75f2e238aa708c645e884d03c000f977de68fc470a2d3ee53","coverage":[{"denominator":109,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T05:40:51.856126Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.13298/citation-record","integrity":"/paper/2607.13298/integrity","json":"/paper/2607.13298/citation-record.json","paper":"/paper/2607.13298"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:40:40.247041Z","title":"Goldfish: Vision- language understanding of arbitrarily long videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13298","last_updated":"2026-07-14T22:09:48Z","snapshot_observed_at":"2026-08-07T01:40:11.166031Z","submitted_at":"2026-07-14T22:09:48Z","title":"FOLIO: Focused Semantic Memory for Streaming Video Understanding","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T05:40:40.247041Z"},"links":{"citing_paper":"/paper/2607.13298"},"observation_digest":"sha256:1efb96a4606e80480b35fe572e67326e41db57390d1255abff5ae181bcbb38d4","observation_id":"92ac4837-9832-4e68-8262-dc1d69fa209a","resolution":{"observed_at":"2026-08-02T05:40:40.247041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-08-17T13:26:10.378579Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-02T05:40:40.306727Z","title":"Qwen3-vl technical report.arXiv preprint arXiv:2511.21631, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13298","last_updated":"2026-07-14T22:09:48Z","snapshot_observed_at":"2026-08-07T01:40:11.166031Z","submitted_at":"2026-07-14T22:09:48Z","title":"FOLIO: Focused Semantic Memory for Streaming Video Understanding","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T05:40:40.306727Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2607.13298"},"observation_digest":"sha256:9bd70938a35b46561c3829521abca7ce363406c151b68389bd6921824fc388f0","observation_id":"3a81e2e3-cfc2-4724-b6ac-39f05d2b2cdf","resolution":{"observed_at":"2026-08-02T05:40:40.306727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:40:40.452140Z","title":"Qwen2.5- vl technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13298","last_updated":"2026-07-14T22:09:48Z","snapshot_observed_at":"2026-08-07T01:40:11.166031Z","submitted_at":"2026-07-14T22:09:48Z","title":"FOLIO: Focused Semantic Memory for Streaming Video Understanding","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T05:40:40.452140Z"},"links":{"citing_paper":"/paper/2607.13298"},"observation_digest":"sha256:f7f8a390a758997808bb37c1d2ee669485b9dbcaa6578ae6509920bfe76c6964","observation_id":"7f6ed852-7b0d-4ada-b19c-0b13bb8d8368","resolution":{"observed_at":"2026-08-02T05:40:40.452140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-02T05:40:40.605291Z","title":"Rt-2: Vision-language-action models transfer web knowledge to robotic control.arXiv preprint arXiv:2307.15818, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13298","last_updated":"2026-07-14T22:09:48Z","snapshot_observed_at":"2026-08-07T01:40:11.166031Z","submitted_at":"2026-07-14T22:09:48Z","title":"FOLIO: Focused Semantic Memory for Streaming Video Understanding","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T05:40:40.605291Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2607.13298"},"observation_digest":"sha256:77b323e42b295d224577ed1288cf4e30d0ee3693bdebaa22e92c10ef7bdf29c7","observation_id":"0479cafa-2f25-455b-a4d4-146c4e4fde04","resolution":{"observed_at":"2026-08-02T05:40:40.605291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:40:40.741228Z","title":"Videollm-online: Online video large language model for streaming video","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13298","last_updated":"2026-07-14T22:09:48Z","snapshot_observed_at":"2026-08-07T01:40:11.166031Z","submitted_at":"2026-07-14T22:09:48Z","title":"FOLIO: Focused Semantic Memory for Streaming Video Understanding","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T05:40:40.741228Z"},"links":{"citing_paper":"/paper/2607.13298"},"observation_digest":"sha256:80263913ce7298d262adde35de70a62f9dc20033e6ac543ca8111cce87bfcc3f","observation_id":"a688e2c5-3b35-408b-8bab-6b496859cd50","resolution":{"observed_at":"2026-08-02T05:40:40.741228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:40:40.914298Z","title":"Livecc: Learning video llm with streaming speech transcription at scale","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13298","last_updated":"2026-07-14T22:09:48Z","snapshot_observed_at":"2026-08-07T01:40:11.166031Z","submitted_at":"2026-07-14T22:09:48Z","title":"FOLIO: Focused Semantic Memory for Streaming Video Understanding","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T05:40:40.914298Z"},"links":{"citing_paper":"/paper/2607.13298"},"observation_digest":"sha256:cb520e7519492699c359a21a9268a2b032c547785e8269ea27f0d28beabf5d7c","observation_id":"0ee16819-6ab5-44a0-8fa5-e1be06dc8d3c","resolution":{"observed_at":"2026-08-02T05:40:40.914298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:40:41.029341Z","title":"Stream- ingtom: Streaming token compression for efficient video understanding.arXiv preprint arXiv:2510.18269, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13298","last_updated":"2026-07-14T22:09:48Z","snapshot_observed_at":"2026-08-07T01:40:11.166031Z","submitted_at":"2026-07-14T22:09:48Z","title":"FOLIO: Focused Semantic Memory for Streaming Video Understanding","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T05:40:41.029341Z"},"links":{"citing_paper":"/paper/2607.13298"},"observation_digest":"sha256:95f9bb79bcef87a9646adbfe2be3b514f7c4d57c59b13b424ef056027b7b6ae8","observation_id":"7a6aa7dc-0924-4bf6-b239-bfd95bb94cfe","resolution":{"observed_at":"2026-08-02T05:40:41.029341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:40:41.155797Z","title":"Streamkv: Streaming video question- answering with segment-based kv cache retrieval and com- pression","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.13298","last_updated":"2026-07-14T22:09:48Z","snapshot_observed_at":"2026-08-07T01:40:11.166031Z","submitted_at":"2026-07-14T22:09:48Z","title":"FOLIO: Focused Semantic Memory for Streaming Video Understanding","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T05:40:41.155797Z"},"links":{"citing_paper":"/paper/2607.13298"},"observation_digest":"sha256:1cb31dddf0f3b2ccf3600a9ccc799e18fe0e4255dc5c398cdcb806b3060e74c3","observation_id":"14909bf9-4e6a-49e3-9ca5-d4b22df09623","resolution":{"observed_at":"2026-08-02T05:40:41.155797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:40:41.318685Z","title":"Streaming video question-answering with in-context video kv-cache retrieval","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13298","last_updated":"2026-07-14T22:09:48Z","snapshot_observed_at":"2026-08-07T01:40:11.166031Z","submitted_at":"2026-07-14T22:09:48Z","title":"FOLIO: Focused Semantic Memory for Streaming Video Understanding","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T05:40:41.318685Z"},"links":{"citing_paper":"/paper/2607.13298"},"observation_digest":"sha256:f8ad8d7ba17fdd1f5341f966a41458d150b8c70a88a6f920d606994954162caf","observation_id":"fb5ef3fe-aa98-483e-86ac-88d8538a82bf","resolution":{"observed_at":"2026-08-02T05:40:41.318685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:40:41.512057Z","title":"Streammind: Un- locking full frame rate streaming video dialogue through event-gated cognition","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13298","last_updated":"2026-07-14T22:09:48Z","snapshot_observed_at":"2026-08-07T01:40:11.166031Z","submitted_at":"2026-07-14T22:09:48Z","title":"FOLIO: Focused Semantic Memory for Streaming Video Understanding","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T05:40:41.512057Z"},"links":{"citing_paper":"/paper/2607.13298"},"observation_digest":"sha256:6d6e9d16e43d744cbf174b7fae1c2474025c13f02eb1e047020bc5a9a3a178f3","observation_id":"69f81289-f454-42ed-8285-5442a4917223","resolution":{"observed_at":"2026-08-02T05:40:41.512057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:40:41.698700Z","title":"Video-mme: The first-ever comprehensive evaluation benchmark of multi-modal llms in video analysis","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13298","last_updated":"2026-07-14T22:09:48Z","snapshot_observed_at":"2026-08-07T01:40:11.166031Z","submitted_at":"2026-07-14T22:09:48Z","title":"FOLIO: Focused Semantic Memory for Streaming Video Understanding","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T05:40:41.698700Z"},"links":{"citing_paper":"/paper/2607.13298"},"observation_digest":"sha256:ad7398cacd1fc6455a1bc3ab33941072812e1d8ca68550b831b3bf57e9299a57","observation_id":"aaa87bcc-a4da-4f84-97cf-5f91d7c1f9f1","resolution":{"observed_at":"2026-08-02T05:40:41.698700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:40:41.819932Z","title":"Vispeak: Visual instruction feedback in streaming videos","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13298","last_updated":"2026-07-14T22:09:48Z","snapshot_observed_at":"2026-08-07T01:40:11.166031Z","submitted_at":"2026-07-14T22:09:48Z","title":"FOLIO: Focused Semantic Memory for Streaming Video Understanding","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T05:40:41.819932Z"},"links":{"citing_paper":"/paper/2607.13298"},"observation_digest":"sha256:67895a5dbb8ba8d560e4d8abbccb42a2be5fc12009e74109498b101237c28a12","observation_id":"ed48361d-44d9-4e21-8907-c207c71036bc","resolution":{"observed_at":"2026-08-02T05:40:41.819932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:40:41.964153Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.13298","last_updated":"2026-07-14T22:09:48Z","snapshot_observed_at":"2026-08-07T01:40:11.166031Z","submitted_at":"2026-07-14T22:09:48Z","title":"FOLIO: Focused Semantic Memory for Streaming Video Understanding","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T05:40:41.964153Z"},"links":{"citing_paper":"/paper/2607.13298"},"observation_digest":"sha256:f554985e706776081b84390d8211fb4f3a3354d08fff2f5588b624b25051c091","observation_id":"a501a3c6-1b7d-4d94-b769-85ad619547f7","resolution":{"observed_at":"2026-08-02T05:40:41.964153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.12262","last_updated":"2026-07-17T07:23:56Z","snapshot_observed_at":"2026-08-09T09:42:44.258435Z","submitted_at":"2026-03-12T17:59:51Z","title":"Video Streaming Thinking: VideoLLMs Can Watch and Think Simultaneously","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.12262","snapshot_observed_at":"2026-08-02T05:40:42.117347Z","title":"Video streaming thinking: Videollms can watch and think simulta- neously.arXiv preprint arXiv:2603.12262, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.13298","last_updated":"2026-07-14T22:09:48Z","snapshot_observed_at":"2026-08-07T01:40:11.166031Z","submitted_at":"2026-07-14T22:09:48Z","title":"FOLIO: Focused Semantic Memory for Streaming Video Understanding","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T05:40:42.117347Z"},"links":{"cited_paper":"/paper/2603.12262","citing_paper":"/paper/2607.13298"},"observation_digest":"sha256:bda73788450e360e7c1e1241ff65f0319e24c34da1327ba521efad6b9bbfef45","observation_id":"107746f8-e14a-43c1-b43d-b04548dc1879","resolution":{"observed_at":"2026-08-02T05:40:42.117347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:40:42.271382Z","title":"Event-vstream: Event-driven real- time understanding for long video streams.arXiv preprint arXiv:2601.15655, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.13298","last_updated":"2026-07-14T22:09:48Z","snapshot_observed_at":"2026-08-07T01:40:11.166031Z","submitted_at":"2026-07-14T22:09:48Z","title":"FOLIO: Focused Semantic Memory for Streaming Video Understanding","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T05:40:42.271382Z"},"links":{"citing_paper":"/paper/2607.13298"},"observation_digest":"sha256:eb4e6ce2a1a1dd042ebac15ecd6c10171e2bcf7bef9760683c2a6c51541434d5","observation_id":"5bb57e00-b804-443d-8a37-9a2b7988ad93","resolution":{"observed_at":"2026-08-02T05:40:42.271382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:40:42.449065Z","title":"Wat: Online video understanding needs watching before thinking.arXiv preprint arXiv:2603.13412, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.13298","last_updated":"2026-07-14T22:09:48Z","snapshot_observed_at":"2026-08-07T01:40:11.166031Z","submitted_at":"2026-07-14T22:09:48Z","title":"FOLIO: Focused Semantic Memory for Streaming Video Understanding","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T05:40:42.449065Z"},"links":{"citing_paper":"/paper/2607.13298"},"observation_digest":"sha256:16e172f15b864c4a48d7a6a2db132523a77c7f6e16d47f25a1ded578c8eab74c","observation_id":"e490df33-f717-4c95-8f2b-3edb8a2da2b3","resolution":{"observed_at":"2026-08-02T05:40:42.449065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:40:42.621001Z","title":"Ma-lmm: Memory-augmented large multimodal model for long-term video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13298","last_updated":"2026-07-14T22:09:48Z","snapshot_observed_at":"2026-08-07T01:40:11.166031Z","submitted_at":"2026-07-14T22:09:48Z","title":"FOLIO: Focused Semantic Memory for Streaming Video Understanding","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T05:40:42.621001Z"},"links":{"citing_paper":"/paper/2607.13298"},"observation_digest":"sha256:2dfb04cbefc650cc0f14c054b6b09be323fd1a809bc6864e0c0bde868869b1c9","observation_id":"77f905a5-107d-437d-903d-fb63d30b704b","resolution":{"observed_at":"2026-08-02T05:40:42.621001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:40:42.775759Z","title":"Online video understanding: Ovbench and videochat- online","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13298","last_updated":"2026-07-14T22:09:48Z","snapshot_observed_at":"2026-08-07T01:40:11.166031Z","submitted_at":"2026-07-14T22:09:48Z","title":"FOLIO: Focused Semantic Memory for Streaming Video Understanding","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T05:40:42.775759Z"},"links":{"citing_paper":"/paper/2607.13298"},"observation_digest":"sha256:c7d6087a15c6b9af9ffdd0d49e1c91584a282a9642dddf2c59b60a8543b0edac","observation_id":"081bdcdd-a42e-4188-85be-6fdbbb6f31ee","resolution":{"observed_at":"2026-08-02T05:40:42.775759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:40:42.873549Z","title":"Online video understanding: Ovbench and videochat- online","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13298","last_updated":"2026-07-14T22:09:48Z","snapshot_observed_at":"2026-08-07T01:40:11.166031Z","submitted_at":"2026-07-14T22:09:48Z","title":"FOLIO: Focused Semantic Memory for Streaming Video Understanding","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T05:40:42.873549Z"},"links":{"citing_paper":"/paper/2607.13298"},"observation_digest":"sha256:864d18734e12a57045cd4723e64c25e4b9f856abd99ad3a24f34b60edcea0421","observation_id":"2df3c5ee-00cc-496d-94d1-c08c20afd595","resolution":{"observed_at":"2026-08-02T05:40:42.873549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:40:43.056189Z","title":"Egospeak: learning when to speak for egocentric conver- sational agents in the wild","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13298","last_updated":"2026-07-14T22:09:48Z","snapshot_observed_at":"2026-08-07T01:40:11.166031Z","submitted_at":"2026-07-14T22:09:48Z","title":"FOLIO: Focused Semantic Memory for Streaming Video Understanding","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T05:40:43.056189Z"},"links":{"citing_paper":"/paper/2607.13298"},"observation_digest":"sha256:2641d890eecbfec772e9ee779c771ada9c1aedc2e167a69c498a909041c63692","observation_id":"5807cf8c-7260-4925-a833-afc4b526ae5a","resolution":{"observed_at":"2026-08-02T05:40:43.056189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:40:43.199978Z","title":"Infinipot-v: Memory-constrained kv cache compres- sion for streaming video understanding.Advances in Neural Information Processing Systems, 38:138983–139013, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.13298","last_updated":"2026-07-14T22:09:48Z","snapshot_observed_at":"2026-08-07T01:40:11.166031Z","submitted_at":"2026-07-14T22:09:48Z","title":"FOLIO: Focused Semantic Memory for Streaming Video Understanding","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T05:40:43.199978Z"},"links":{"citing_paper":"/paper/2607.13298"},"observation_digest":"sha256:34bda96a29c8856f9514c03ee085734442d907cc535b938ead8a64c257d90d47","observation_id":"b850061b-9fc1-4dc8-b962-d4d8ab59c382","resolution":{"observed_at":"2026-08-02T05:40:43.199978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.06180","snapshot_observed_at":"2026-08-02T05:40:43.359412Z","title":"Gonzalez, Hao Zhang, and Ion Stoica","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13298","last_updated":"2026-07-14T22:09:48Z","snapshot_observed_at":"2026-08-07T01:40:11.166031Z","submitted_at":"2026-07-14T22:09:48Z","title":"FOLIO: Focused Semantic Memory for Streaming Video Understanding","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T05:40:43.359412Z"},"links":{"cited_paper":"/paper/2309.06180","citing_paper":"/paper/2607.13298"},"observation_digest":"sha256:9e260fcfdb980c7a9279d5d2360bcac7cf86f3449b73f8ef2fc728555803d0ee","observation_id":"7d5c096b-6768-48af-949b-2462e88db09e","resolution":{"observed_at":"2026-08-02T05:40:43.359412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:40:43.502119Z","title":"Mvbench: A comprehensive multi-modal video understand- ing benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13298","last_updated":"2026-07-14T22:09:48Z","snapshot_observed_at":"2026-08-07T01:40:11.166031Z","submitted_at":"2026-07-14T22:09:48Z","title":"FOLIO: Focused Semantic Memory for Streaming Video Understanding","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T05:40:43.502119Z"},"links":{"citing_paper":"/paper/2607.13298"},"observation_digest":"sha256:8dcb37e2500ba7c7a4e0527add2ac03dba370deec191fedefaf9d15769a136f4","observation_id":"1e6a4946-ae7c-4d80-afb7-c196369fcdbc","resolution":{"observed_at":"2026-08-02T05:40:43.502119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:40:43.627646Z","title":"Videochat: Chat-centric video understanding.Science China Information Sciences, 68(10):200102, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13298","last_updated":"2026-07-14T22:09:48Z","snapshot_observed_at":"2026-08-07T01:40:11.166031Z","submitted_at":"2026-07-14T22:09:48Z","title":"FOLIO: Focused Semantic Memory for Streaming Video Understanding","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T05:40:43.627646Z"},"links":{"citing_paper":"/paper/2607.13298"},"observation_digest":"sha256:4e21c10c8136ccc2dec3493aafaf84e49109eb7c87c5ab8d803d364f10cee578","observation_id":"bda3111c-9c49-4876-9324-1a8fb354f293","resolution":{"observed_at":"2026-08-02T05:40:43.627646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:40:43.826258Z","title":"Freshmem: Brain-inspired frequency-space hybrid memory for streaming video understanding.arXiv preprint arXiv:2602.01683, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.13298","last_updated":"2026-07-14T22:09:48Z","snapshot_observed_at":"2026-08-07T01:40:11.166031Z","submitted_at":"2026-07-14T22:09:48Z","title":"FOLIO: Focused Semantic Memory for Streaming Video Understanding","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T05:40:43.826258Z"},"links":{"citing_paper":"/paper/2607.13298"},"observation_digest":"sha256:457c4bf0b932708cb534fe460207879c5ce4afce3282e77089f2900090bab18d","observation_id":"1ab66b5b-be95-41e6-903f-5da02a10e35a","resolution":{"observed_at":"2026-08-02T05:40:43.826258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:40:44.115029Z","title":"Lion-fs: Fast & slow video-language thinker as online video assistant","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13298","last_updated":"2026-07-14T22:09:48Z","snapshot_observed_at":"2026-08-07T01:40:11.166031Z","submitted_at":"2026-07-14T22:09:48Z","title":"FOLIO: Focused Semantic Memory for Streaming Video Understanding","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-02T05:40:44.115029Z"},"links":{"citing_paper":"/paper/2607.13298"},"observation_digest":"sha256:2c0a711e8d6f8eec60882766faf0b39ecf975487a680f7bd3decb102eca25787","observation_id":"3d96b5dd-5104-4155-85cc-0630da8851e7","resolution":{"observed_at":"2026-08-02T05:40:44.115029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:40:44.185626Z","title":"Llama-vid: An im- age is worth 2 tokens in large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13298","last_updated":"2026-07-14T22:09:48Z","snapshot_observed_at":"2026-08-07T01:40:11.166031Z","submitted_at":"2026-07-14T22:09:48Z","title":"FOLIO: Focused Semantic Memory for Streaming Video Understanding","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-02T05:40:44.185626Z"},"links":{"citing_paper":"/paper/2607.13298"},"observation_digest":"sha256:2f28880c0cefbd9cde022a939f18ecdaa754af1b0fc140ac2e243c24c7fbe876","observation_id":"8f77d249-e872-4ec2-bda3-c531a1e69f58","resolution":{"observed_at":"2026-08-02T05:40:44.185626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.01455","last_updated":"2026-04-21T05:06:35Z","snapshot_observed_at":"2026-08-12T13:53:11.307850Z","submitted_at":"2026-03-02T05:12:45Z","title":"From Verbatim to Gist: Distilling Pyramidal Multimodal Memory via Semantic Information Bottleneck for Long-Horizon Video Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.01455","snapshot_observed_at":"2026-08-02T05:40:44.305707Z","title":"From verbatim to gist: Distilling pyramidal multimodal memory via semantic information bottleneck for long-horizon video agents.arXiv preprint arXiv:2603.01455, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.13298","last_updated":"2026-07-14T22:09:48Z","snapshot_observed_at":"2026-08-07T01:40:11.166031Z","submitted_at":"2026-07-14T22:09:48Z","title":"FOLIO: Focused Semantic Memory for Streaming Video Understanding","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T05:40:44.305707Z"},"links":{"cited_paper":"/paper/2603.01455","citing_paper":"/paper/2607.13298"},"observation_digest":"sha256:707997272795b87c55cb8c12644bcbdceb3071fa24804b4b3c529271e1347dde","observation_id":"17f89242-abae-4e70-a51f-d88a8812ddd7","resolution":{"observed_at":"2026-08-02T05:40:44.305707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.17052","last_updated":"2026-04-18T16:22:05Z","snapshot_observed_at":"2026-08-13T14:22:51.440674Z","submitted_at":"2026-04-18T16:22:05Z","title":"OASIS: On-Demand Hierarchical Event Memory for Streaming Video Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.17052","snapshot_observed_at":"2026-08-02T05:40:44.418468Z","title":"Oasis: On-demand hierarchical event memory for streaming video reasoning.arXiv preprint arXiv:2604.17052, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.13298","last_updated":"2026-07-14T22:09:48Z","snapshot_observed_at":"2026-08-07T01:40:11.166031Z","submitted_at":"2026-07-14T22:09:48Z","title":"FOLIO: Focused Semantic Memory for Streaming Video Understanding","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-02T05:40:44.418468Z"},"links":{"cited_paper":"/paper/2604.17052","citing_paper":"/paper/2607.13298"},"observation_digest":"sha256:298260fa4b1de6457ab300d157d9e6023f24e1902bc9286533a2baf01627a663","observation_id":"1091435e-598c-427f-a6a2-4e5c27be402c","resolution":{"observed_at":"2026-08-02T05:40:44.418468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:40:44.553170Z","title":"Video-llava: Learning united visual represen- tation by alignment before projection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13298","last_updated":"2026-07-14T22:09:48Z","snapshot_observed_at":"2026-08-07T01:40:11.166031Z","submitted_at":"2026-07-14T22:09:48Z","title":"FOLIO: Focused Semantic Memory for Streaming Video Understanding","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-02T05:40:44.553170Z"},"links":{"citing_paper":"/paper/2607.13298"},"observation_digest":"sha256:6f1debf542dca5847689629dfb2fa5dc91b2ccf32efc67f5958615428068645b","observation_id":"92f3fb23-0d68-4153-92d6-f3aa4d9fee15","resolution":{"observed_at":"2026-08-02T05:40:44.553170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:40:44.705540Z","title":"Streamingbench: Assessing the gap for mllms to achieve streaming video understanding","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.13298","last_updated":"2026-07-14T22:09:48Z","snapshot_observed_at":"2026-08-07T01:40:11.166031Z","submitted_at":"2026-07-14T22:09:48Z","title":"FOLIO: Focused Semantic Memory for Streaming Video Understanding","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-02T05:40:44.705540Z"},"links":{"citing_paper":"/paper/2607.13298"},"observation_digest":"sha256:5471ab6f46bbbfd176c79ad315816c21c46ca80f71dd6f81356274553d2263a8","observation_id":"8587f1db-61ae-400d-bbb2-8a1b62ff0a7f","resolution":{"observed_at":"2026-08-02T05:40:44.705540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:40:44.823539Z","title":"Speak while watch- ing: Unleashing true real-time video understanding capabil- ity of multimodal large language models.arXiv preprint arXiv:2601.06843, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.13298","last_updated":"2026-07-14T22:09:48Z","snapshot_observed_at":"2026-08-07T01:40:11.166031Z","submitted_at":"2026-07-14T22:09:48Z","title":"FOLIO: Focused Semantic Memory for Streaming Video Understanding","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-02T05:40:44.823539Z"},"links":{"citing_paper":"/paper/2607.13298"},"observation_digest":"sha256:ca18ab6cacccf919171d11b2f5d64e0c6b5d84f21143a0c6c4b675a2e8c66ce7","observation_id":"f2642ebb-3cd7-411a-8d0b-35309ccac26f","resolution":{"observed_at":"2026-08-02T05:40:44.823539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.08646","last_updated":"2025-03-30T05:25:58Z","snapshot_observed_at":"2026-08-16T13:00:14.848164Z","submitted_at":"2024-12-11T18:59:54Z","title":"StreamChat: Chatting with Streaming Video","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.08646","snapshot_observed_at":"2026-08-02T05:40:44.938616Z","title":"Stream- chat: Chatting with streaming video.arXiv preprint arXiv:2412.08646, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13298","last_updated":"2026-07-14T22:09:48Z","snapshot_observed_at":"2026-08-07T01:40:11.166031Z","submitted_at":"2026-07-14T22:09:48Z","title":"FOLIO: Focused Semantic Memory for Streaming Video Understanding","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-02T05:40:44.938616Z"},"links":{"cited_paper":"/paper/2412.08646","citing_paper":"/paper/2607.13298"},"observation_digest":"sha256:000950b36c065e5ab4997dcbc5d9cd0d23586762567a2ae78270bc38a12a3511","observation_id":"ad9e9908-1673-475f-8184-7fe191510732","resolution":{"observed_at":"2026-08-02T05:40:44.938616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:40:45.041545Z","title":"Thinking in streaming video.arXiv preprint arXiv:2603.12938, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.13298","last_updated":"2026-07-14T22:09:48Z","snapshot_observed_at":"2026-08-07T01:40:11.166031Z","submitted_at":"2026-07-14T22:09:48Z","title":"FOLIO: Focused Semantic Memory for Streaming Video Understanding","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-02T05:40:45.041545Z"},"links":{"citing_paper":"/paper/2607.13298"},"observation_digest":"sha256:fd30252771d89500dad55969e0bad48e8af65087e993cb2947f0831830d708ee","observation_id":"2a3f4126-9c8d-4ef7-b8bf-5b3c671e7c91","resolution":{"observed_at":"2026-08-02T05:40:45.041545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:40:45.193669Z","title":"Vista: Scene-aware optimization for streaming video question answering under post-hoc queries","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.13298","last_updated":"2026-07-14T22:09:48Z","snapshot_observed_at":"2026-08-07T01:40:11.166031Z","submitted_at":"2026-07-14T22:09:48Z","title":"FOLIO: Focused Semantic Memory for Streaming Video Understanding","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-02T05:40:45.193669Z"},"links":{"citing_paper":"/paper/2607.13298"},"observation_digest":"sha256:1ed5a8e78824320cce17fde08cdd3d45026cc2092222446bc773e87af05eaf10","observation_id":"78f33efa-3b2b-40ba-8415-07c4ba057f3d","resolution":{"observed_at":"2026-08-02T05:40:45.193669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.04184","last_updated":"2026-04-05T16:53:46Z","snapshot_observed_at":"2026-08-14T11:57:19.486396Z","submitted_at":"2026-04-05T16:53:46Z","title":"AURA: Always-On Understanding and Real-Time Assistance via Video Streams","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.04184","snapshot_observed_at":"2026-08-02T05:40:45.373894Z","title":"Aura: Always-on understanding and real-time assistance via video streams.arXiv preprint arXiv:2604.04184, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.13298","last_updated":"2026-07-14T22:09:48Z","snapshot_observed_at":"2026-08-07T01:40:11.166031Z","submitted_at":"2026-07-14T22:09:48Z","title":"FOLIO: Focused Semantic Memory for Streaming Video Understanding","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-02T05:40:45.373894Z"},"links":{"cited_paper":"/paper/2604.04184","citing_paper":"/paper/2607.13298"},"observation_digest":"sha256:04a83b1eba03d0e28d097290cf0bdaa9eea7c294c2b86eaf120b4648798d40e3","observation_id":"3a9ff75c-1b94-48bd-9934-4e3c38157c8c","resolution":{"observed_at":"2026-08-02T05:40:45.373894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:40:45.506793Z","title":"Video-rag: Visually-aligned retrieval-augmented long video comprehension.Advances in Neural Information Processing Systems, 38:168008–168033, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.13298","last_updated":"2026-07-14T22:09:48Z","snapshot_observed_at":"2026-08-07T01:40:11.166031Z","submitted_at":"2026-07-14T22:09:48Z","title":"FOLIO: Focused Semantic Memory for Streaming Video Understanding","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-02T05:40:45.506793Z"},"links":{"citing_paper":"/paper/2607.13298"},"observation_digest":"sha256:8618606e3d60502cb5540aad049d6de0f3d2501f95f5dc3bc43bdec649e4fa87","observation_id":"2ed3d7f9-7eb5-46c5-8867-e8c14836dea8","resolution":{"observed_at":"2026-08-02T05:40:45.506793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:40:45.677511Z","title":"Egoschema: A diagnostic benchmark for very long- form video language understanding.Advances in Neural Information Processing Systems, 36:46212–46244, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13298","last_updated":"2026-07-14T22:09:48Z","snapshot_observed_at":"2026-08-07T01:40:11.166031Z","submitted_at":"2026-07-14T22:09:48Z","title":"FOLIO: Focused Semantic Memory for Streaming Video Understanding","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-02T05:40:45.677511Z"},"links":{"citing_paper":"/paper/2607.13298"},"observation_digest":"sha256:21aca80e86214f812f8950bfff7a0e10e0d1f09451430fd0994524caa330fa2c","observation_id":"05e9de73-c8f6-44e3-8062-9647d20c60fc","resolution":{"observed_at":"2026-08-02T05:40:45.677511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15269","last_updated":"2026-04-23T12:54:38Z","snapshot_observed_at":"2026-08-12T15:58:40.311449Z","submitted_at":"2025-05-21T08:47:15Z","title":"LiveVLM: Efficient Online Video Understanding via Streaming-Oriented KV Cache and Retrieval","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15269","snapshot_observed_at":"2026-08-02T05:40:45.851326Z","title":"Livevlm: Efficient online video understanding via streaming-oriented kv cache and retrieval.arXiv preprint arXiv:2505.15269, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13298","last_updated":"2026-07-14T22:09:48Z","snapshot_observed_at":"2026-08-07T01:40:11.166031Z","submitted_at":"2026-07-14T22:09:48Z","title":"FOLIO: Focused Semantic Memory for Streaming Video Understanding","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-02T05:40:45.851326Z"},"links":{"cited_paper":"/paper/2505.15269","citing_paper":"/paper/2607.13298"},"observation_digest":"sha256:58163d8efd5160328a2bfa9ca34445711d71741faad10fa401ed087952fb6267","observation_id":"f15bfcc4-c98f-42c7-9fd9-66f8cdccd5e3","resolution":{"observed_at":"2026-08-02T05:40:45.851326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:40:45.954821Z","title":"Ovo-bench: How far is your video-llms from real-world online video understanding? InProceedings of the Computer Vision and Pattern Recognition Conference, pages 18902–18913, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13298","last_updated":"2026-07-14T22:09:48Z","snapshot_observed_at":"2026-08-07T01:40:11.166031Z","submitted_at":"2026-07-14T22:09:48Z","title":"FOLIO: Focused Semantic Memory for Streaming Video Understanding","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-02T05:40:45.954821Z"},"links":{"citing_paper":"/paper/2607.13298"},"observation_digest":"sha256:b22c8a2613c57148bdeff6351788a42c715fd167bb775e3ea378d0615803c895","observation_id":"ded841e7-4165-450c-9c6e-0088580aadf0","resolution":{"observed_at":"2026-08-02T05:40:45.954821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:40:46.189047Z","title":"Streaming long video un- derstanding with large language models.Advances in Neural Information Processing Systems, 37:119336–119360, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13298","last_updated":"2026-07-14T22:09:48Z","snapshot_observed_at":"2026-08-07T01:40:11.166031Z","submitted_at":"2026-07-14T22:09:48Z","title":"FOLIO: Focused Semantic Memory for Streaming Video Understanding","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-02T05:40:46.189047Z"},"links":{"citing_paper":"/paper/2607.13298"},"observation_digest":"sha256:9ca33d94cadbbecc7e037616870928c2caea35ee62dc67272ed19fa8816c07d7","observation_id":"9a9088c7-d080-427d-a439-abbca51f0799","resolution":{"observed_at":"2026-08-02T05:40:46.189047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19225","last_updated":"2025-06-24T01:19:56Z","snapshot_observed_at":"2026-08-14T14:43:02.885779Z","submitted_at":"2025-06-24T01:19:56Z","title":"Video-XL-2: Towards Very Long-Video Understanding Through Task-Aware KV Sparsification","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.19225","snapshot_observed_at":"2026-08-02T05:40:46.344843Z","title":"Video-xl-2: Towards very long-video under- standing through task-aware kv sparsification.arXiv preprint arXiv:2506.19225, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13298","last_updated":"2026-07-14T22:09:48Z","snapshot_observed_at":"2026-08-07T01:40:11.166031Z","submitted_at":"2026-07-14T22:09:48Z","title":"FOLIO: Focused Semantic Memory for Streaming Video Understanding","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-02T05:40:46.344843Z"},"links":{"cited_paper":"/paper/2506.19225","citing_paper":"/paper/2607.13298"},"observation_digest":"sha256:daf0ea26ade1881fa0b557d8456e52cd117e4ea0dc87c7fdd4bdd8cb118d3270","observation_id":"605428c9-ced5-4e26-b65c-746de9d130bc","resolution":{"observed_at":"2026-08-02T05:40:46.344843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17434","last_updated":"2024-10-22T21:21:37Z","snapshot_observed_at":"2026-08-13T11:36:11.821356Z","submitted_at":"2024-10-22T21:21:37Z","title":"LongVU: Spatiotemporal Adaptive Compression for Long Video-Language Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.17434","snapshot_observed_at":"2026-08-02T05:40:46.409301Z","title":"Longvu: Spa- tiotemporal adaptive compression for long video-language understanding.arXiv preprint arXiv:2410.17434, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13298","last_updated":"2026-07-14T22:09:48Z","snapshot_observed_at":"2026-08-07T01:40:11.166031Z","submitted_at":"2026-07-14T22:09:48Z","title":"FOLIO: Focused Semantic Memory for Streaming Video Understanding","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-02T05:40:46.409301Z"},"links":{"cited_paper":"/paper/2410.17434","citing_paper":"/paper/2607.13298"},"observation_digest":"sha256:f53e3423d9d5f1600f1440016e0472bb99f5bf027c78e5afec6da853d1849848","observation_id":"650776ae-51d1-4984-b7b1-88e9454365e2","resolution":{"observed_at":"2026-08-02T05:40:46.409301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:40:46.495255Z","title":"A simple baseline for streaming video understanding.arXiv preprint arXiv:2604.02317, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.13298","last_updated":"2026-07-14T22:09:48Z","snapshot_observed_at":"2026-08-07T01:40:11.166031Z","submitted_at":"2026-07-14T22:09:48Z","title":"FOLIO: Focused Semantic Memory for Streaming Video Understanding","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-02T05:40:46.495255Z"},"links":{"citing_paper":"/paper/2607.13298"},"observation_digest":"sha256:0970919e688fa55f9648f92cffd2ce2442d06c7660f4b6ae39cbfd2f0c6db090","observation_id":"bc26dce3-1ee7-4bcf-98aa-63514a5f5157","resolution":{"observed_at":"2026-08-02T05:40:46.495255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:40:46.570307Z","title":"Video- xl: Extra-long vision language model for hour-scale video understanding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13298","last_updated":"2026-07-14T22:09:48Z","snapshot_observed_at":"2026-08-07T01:40:11.166031Z","submitted_at":"2026-07-14T22:09:48Z","title":"FOLIO: Focused Semantic Memory for Streaming Video Understanding","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-02T05:40:46.570307Z"},"links":{"citing_paper":"/paper/2607.13298"},"observation_digest":"sha256:d520c246e301847cc01103ffed9af0d4abec9e52bebd3a47d6fcf5c7a8beec1e","observation_id":"fc3ebf61-ac61-4d73-8c64-b465e1d70c48","resolution":{"observed_at":"2026-08-02T05:40:46.570307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14150","last_updated":"2025-01-16T10:57:44Z","snapshot_observed_at":"2026-08-19T12:47:50.220214Z","submitted_at":"2023-12-21T18:59:12Z","title":"DriveLM: Driving with Graph Visual Question Answering","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14150","snapshot_observed_at":"2026-08-02T05:40:46.637545Z","title":"Drivelm: Driving with graph visual question answering.arXiv preprint arXiv:2312.14150, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13298","last_updated":"2026-07-14T22:09:48Z","snapshot_observed_at":"2026-08-07T01:40:11.166031Z","submitted_at":"2026-07-14T22:09:48Z","title":"FOLIO: Focused Semantic Memory for Streaming Video Understanding","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-02T05:40:46.637545Z"},"links":{"cited_paper":"/paper/2312.14150","citing_paper":"/paper/2607.13298"},"observation_digest":"sha256:618171c62308ba9dde960a837b83539fe1c26f285705db3af6f9d2d8ba0c84e6","observation_id":"6ad2b717-5d22-4ca6-bd10-fc8d39291973","resolution":{"observed_at":"2026-08-02T05:40:46.637545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:40:46.747360Z","title":"Moviechat: From dense token to sparse memory for long video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13298","last_updated":"2026-07-14T22:09:48Z","snapshot_observed_at":"2026-08-07T01:40:11.166031Z","submitted_at":"2026-07-14T22:09:48Z","title":"FOLIO: Focused Semantic Memory for Streaming Video Understanding","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-02T05:40:46.747360Z"},"links":{"citing_paper":"/paper/2607.13298"},"observation_digest":"sha256:45c9f9e40e3a65dc6243ae517e1c5999ccce79d5c1dbcf2c0c392e3afd6beaec","observation_id":"48beaaa8-0c4d-4a49-b98d-0f16b4059af5","resolution":{"observed_at":"2026-08-02T05:40:46.747360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:40:46.819805Z","title":"Curvestream: Boosting streaming video understanding in mllms via curvature-aware hierarchical visual memory management.arXiv preprint arXiv:2603.19571, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.13298","last_updated":"2026-07-14T22:09:48Z","snapshot_observed_at":"2026-08-07T01:40:11.166031Z","submitted_at":"2026-07-14T22:09:48Z","title":"FOLIO: Focused Semantic Memory for Streaming Video Understanding","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-02T05:40:46.819805Z"},"links":{"citing_paper":"/paper/2607.13298"},"observation_digest":"sha256:42d2ab3f36177c4bb095cf9a8ca63849ccaf5d113bcec5bed2bcec3b74fe2028","observation_id":"7b0d9cc7-cb53-473b-885c-d31b388862e0","resolution":{"observed_at":"2026-08-02T05:40:46.819805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:40:46.933674Z","title":"Streambridge: Turning your offline video large language model into a proactive streaming assistant.Advances in Neural Information Processing Systems, 38:132332–132359,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13298","last_updated":"2026-07-14T22:09:48Z","snapshot_observed_at":"2026-08-07T01:40:11.166031Z","submitted_at":"2026-07-14T22:09:48Z","title":"FOLIO: Focused Semantic Memory for Streaming Video Understanding","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-02T05:40:46.933674Z"},"links":{"citing_paper":"/paper/2607.13298"},"observation_digest":"sha256:d79a0aa927cc31fc85dbeefd73ceffb2168cdb0b7579a2178ce0364572685e4d","observation_id":"bd93c51b-bb06-4b14-b2db-d279c7a12004","resolution":{"observed_at":"2026-08-02T05:40:46.933674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:40:47.033786Z","title":"Think while watching: Online streaming segment-level memory for multi-turn video rea- soning in multimodal large language models.arXiv preprint arXiv:2603.11896, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.13298","last_updated":"2026-07-14T22:09:48Z","snapshot_observed_at":"2026-08-07T01:40:11.166031Z","submitted_at":"2026-07-14T22:09:48Z","title":"FOLIO: Focused Semantic Memory for Streaming Video Understanding","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-02T05:40:47.033786Z"},"links":{"citing_paper":"/paper/2607.13298"},"observation_digest":"sha256:ec5e07c6832ba3018d4cba013ee514d113e9620e87ee97f20bf499cdffa23430","observation_id":"4e230ec5-8c08-4fb5-84e0-4deef257fefa","resolution":{"observed_at":"2026-08-02T05:40:47.033786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-02T05:40:47.124727Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution.arXiv preprint arXiv:2409.12191, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13298","last_updated":"2026-07-14T22:09:48Z","snapshot_observed_at":"2026-08-07T01:40:11.166031Z","submitted_at":"2026-07-14T22:09:48Z","title":"FOLIO: Focused Semantic Memory for Streaming Video Understanding","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-02T05:40:47.124727Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2607.13298"},"observation_digest":"sha256:7affbd9e579c4e259aa69421b0350b2591b8c0d04c0564b0c423d8b93d26a5a1","observation_id":"e33e8f60-d39f-4d70-9a51-95a1f489eb80","resolution":{"observed_at":"2026-08-02T05:40:47.124727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:40:47.227901Z","title":"Lvbench: An extreme long video understanding benchmark","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13298","last_updated":"2026-07-14T22:09:48Z","snapshot_observed_at":"2026-08-07T01:40:11.166031Z","submitted_at":"2026-07-14T22:09:48Z","title":"FOLIO: Focused Semantic Memory for Streaming Video Understanding","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-02T05:40:47.227901Z"},"links":{"citing_paper":"/paper/2607.13298"},"observation_digest":"sha256:927d8a6f81f3c14394b68faf3d52b19f9dbaea4319f1aa95b3faf89594767a44","observation_id":"cb7b1314-5322-4540-b46f-d7430e60f5f1","resolution":{"observed_at":"2026-08-02T05:40:47.227901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:40:47.319098Z","title":"Videoagent: Long-form video understanding with large language model as agent","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13298","last_updated":"2026-07-14T22:09:48Z","snapshot_observed_at":"2026-08-07T01:40:11.166031Z","submitted_at":"2026-07-14T22:09:48Z","title":"FOLIO: Focused Semantic Memory for Streaming Video Understanding","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-02T05:40:47.319098Z"},"links":{"citing_paper":"/paper/2607.13298"},"observation_digest":"sha256:e6d19d2bd6b0370253a310a197f646ad7847abf71d27e183e1eccb8482df735e","observation_id":"c97a63f8-117c-4ce7-bed3-8418963d3b18","resolution":{"observed_at":"2026-08-02T05:40:47.319098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:40:47.388001Z","title":"Internvideo2: Scaling foundation models for mul- timodal video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13298","last_updated":"2026-07-14T22:09:48Z","snapshot_observed_at":"2026-08-07T01:40:11.166031Z","submitted_at":"2026-07-14T22:09:48Z","title":"FOLIO: Focused Semantic Memory for Streaming Video Understanding","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-02T05:40:47.388001Z"},"links":{"citing_paper":"/paper/2607.13298"},"observation_digest":"sha256:f32251e417a45aeed6e0be05e06722e19d16e8500ce42dd2ea96acd7805387b1","observation_id":"d76a5321-1bb3-4b94-89cf-5c1bab3eba79","resolution":{"observed_at":"2026-08-02T05:40:47.388001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:40:47.488282Z","title":"Vide- ollm knows when to speak: Enhancing time-sensitive video comprehension with video-text duet interaction format.arXiv preprint arXiv:2411.17991, 1(3):5, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13298","last_updated":"2026-07-14T22:09:48Z","snapshot_observed_at":"2026-08-07T01:40:11.166031Z","submitted_at":"2026-07-14T22:09:48Z","title":"FOLIO: Focused Semantic Memory for Streaming Video Understanding","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-02T05:40:47.488282Z"},"links":{"citing_paper":"/paper/2607.13298"},"observation_digest":"sha256:2feded4a4f2aa52eb08b71713f7bb7329e4c2c251a673996d775be9e2c95ed22","observation_id":"ef2e1078-8004-42e4-be1d-af9ad1cf3ece","resolution":{"observed_at":"2026-08-02T05:40:47.488282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:40:47.593361Z","title":"Acceler- ating streaming video large language models via hierarchical token compression.arXiv preprint arXiv:2512.00891, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13298","last_updated":"2026-07-14T22:09:48Z","snapshot_observed_at":"2026-08-07T01:40:11.166031Z","submitted_at":"2026-07-14T22:09:48Z","title":"FOLIO: Focused Semantic Memory for Streaming Video Understanding","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-02T05:40:47.593361Z"},"links":{"citing_paper":"/paper/2607.13298"},"observation_digest":"sha256:1d6f626e0eef94d88502844ca0e0ebb5a8b32e35c536211cc0150292ae96b8a5","observation_id":"67807932-6bcb-4079-bc9e-51b5674d8a18","resolution":{"observed_at":"2026-08-02T05:40:47.593361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:40:47.678186Z","title":"Omnimmi: A comprehensive multi- modal interaction benchmark in streaming video contexts","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13298","last_updated":"2026-07-14T22:09:48Z","snapshot_observed_at":"2026-08-07T01:40:11.166031Z","submitted_at":"2026-07-14T22:09:48Z","title":"FOLIO: Focused Semantic Memory for Streaming Video Understanding","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-02T05:40:47.678186Z"},"links":{"citing_paper":"/paper/2607.13298"},"observation_digest":"sha256:1155a2f5de31837202b9459cf99d36bf6a57961a547db290ae56149e4d362928","observation_id":"7e988e12-3a32-4484-bcf9-1a4d670c3047","resolution":{"observed_at":"2026-08-02T05:40:47.678186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:40:47.760523Z","title":"Episodic memory representation for long- form video understanding.arXiv preprint arXiv:2508.09486,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13298","last_updated":"2026-07-14T22:09:48Z","snapshot_observed_at":"2026-08-07T01:40:11.166031Z","submitted_at":"2026-07-14T22:09:48Z","title":"FOLIO: Focused Semantic Memory for Streaming Video Understanding","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-02T05:40:47.760523Z"},"links":{"citing_paper":"/paper/2607.13298"},"observation_digest":"sha256:ebf6792ce8bedb683da5e95b37e40a32ef1a9b66af5d09d49b54953d1e9fcb2f","observation_id":"a27e5a17-8fd0-48d6-936b-6cb4d038a4e0","resolution":{"observed_at":"2026-08-02T05:40:47.760523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:40:47.792484Z","title":"11 Videotree: Adaptive tree-based video representation for llm reasoning on long videos","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13298","last_updated":"2026-07-14T22:09:48Z","snapshot_observed_at":"2026-08-07T01:40:11.166031Z","submitted_at":"2026-07-14T22:09:48Z","title":"FOLIO: Focused Semantic Memory for Streaming Video Understanding","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-02T05:40:47.792484Z"},"links":{"citing_paper":"/paper/2607.13298"},"observation_digest":"sha256:0cffe455c479913b5ab9fba38569a6a5106ad5b998c2a37e636f8ad85eb0c258","observation_id":"19830a06-27c4-4b28-8a0d-bded57fd4607","resolution":{"observed_at":"2026-08-02T05:40:47.792484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:40:47.845688Z","title":"Eventmemagent: Hierarchical event-centric memory for online video understanding with adaptive tool use.arXiv preprint arXiv:2602.15329, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.13298","last_updated":"2026-07-14T22:09:48Z","snapshot_observed_at":"2026-08-07T01:40:11.166031Z","submitted_at":"2026-07-14T22:09:48Z","title":"FOLIO: Focused Semantic Memory for Streaming Video Understanding","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-02T05:40:47.845688Z"},"links":{"citing_paper":"/paper/2607.13298"},"observation_digest":"sha256:3e770c649499c3f7bfde7502063921ef2fc744bda9bb82473507990fd1da5cea","observation_id":"94b2a429-ce9e-4a0a-830f-b1825ec08421","resolution":{"observed_at":"2026-08-02T05:40:47.845688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:40:47.951763Z","title":"Videollm-mod: Efficient video-language streaming with mixture-of-depths vision computation.Ad- vances in Neural Information Processing Systems, 37:109922– 109947, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13298","last_updated":"2026-07-14T22:09:48Z","snapshot_observed_at":"2026-08-07T01:40:11.166031Z","submitted_at":"2026-07-14T22:09:48Z","title":"FOLIO: Focused Semantic Memory for Streaming Video Understanding","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-02T05:40:47.951763Z"},"links":{"citing_paper":"/paper/2607.13298"},"observation_digest":"sha256:afa8c9455a25b6dd343af8882cfb0d531a19ae9f648397ac521b807835c30859","observation_id":"191388df-15e1-42c8-8b09-b91be30caf2b","resolution":{"observed_at":"2026-08-02T05:40:47.951763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:40:48.015629Z","title":"Next-qa: Next phase of question-answering to explaining tem- poral actions","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13298","last_updated":"2026-07-14T22:09:48Z","snapshot_observed_at":"2026-08-07T01:40:11.166031Z","submitted_at":"2026-07-14T22:09:48Z","title":"FOLIO: Focused Semantic Memory for Streaming Video Understanding","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-02T05:40:48.015629Z"},"links":{"citing_paper":"/paper/2607.13298"},"observation_digest":"sha256:d2ed98c41ec064d730176ecde663c9fa47cbe24e08169d37023551ae3fb16999","observation_id":"cfcffe0f-ea85-4ff8-8acc-0b9172dc8fde","resolution":{"observed_at":"2026-08-02T05:40:48.015629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:40:48.051409Z","title":"Fluxmem: Adaptive hierarchical memory for streaming video understanding.arXiv preprint arXiv:2603.02096, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.13298","last_updated":"2026-07-14T22:09:48Z","snapshot_observed_at":"2026-08-07T01:40:11.166031Z","submitted_at":"2026-07-14T22:09:48Z","title":"FOLIO: Focused Semantic Memory for Streaming Video Understanding","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-02T05:40:48.051409Z"},"links":{"citing_paper":"/paper/2607.13298"},"observation_digest":"sha256:ee0cce5ceb309f356fea784890c23b3db339a14d6a1e1ac9e44462376732ef29","observation_id":"7102de25-5625-4e77-920e-5c55ba83be56","resolution":{"observed_at":"2026-08-02T05:40:48.051409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13468","last_updated":"2025-01-23T08:33:10Z","snapshot_observed_at":"2026-08-17T02:49:36.622314Z","submitted_at":"2025-01-23T08:33:10Z","title":"Streaming Video Understanding and Multi-round Interaction with Memory-enhanced Knowledge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13468","snapshot_observed_at":"2026-08-02T05:40:48.131445Z","title":"Streaming video under- standing and multi-round interaction with memory-enhanced knowledge.arXiv preprint arXiv:2501.13468, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13298","last_updated":"2026-07-14T22:09:48Z","snapshot_observed_at":"2026-08-07T01:40:11.166031Z","submitted_at":"2026-07-14T22:09:48Z","title":"FOLIO: Focused Semantic Memory for Streaming Video Understanding","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-02T05:40:48.131445Z"},"links":{"cited_paper":"/paper/2501.13468","citing_paper":"/paper/2607.13298"},"observation_digest":"sha256:9d1ec2c4af2fd63053e6a60b34bd6b18f91808e240b31b8b056d2bf0f5b37a3e","observation_id":"a35e0a5b-0773-466f-8269-8709cf983134","resolution":{"observed_at":"2026-08-02T05:40:48.131445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.09608","last_updated":"2025-10-10T17:59:58Z","snapshot_observed_at":"2026-08-19T16:53:15.380005Z","submitted_at":"2025-10-10T17:59:58Z","title":"StreamingVLM: Real-Time Understanding for Infinite Video Streams","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.09608","snapshot_observed_at":"2026-08-02T05:40:48.277130Z","title":"Streamingvlm: Real-time understanding for infinite video streams.arXiv preprint arXiv:2510.09608, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13298","last_updated":"2026-07-14T22:09:48Z","snapshot_observed_at":"2026-08-07T01:40:11.166031Z","submitted_at":"2026-07-14T22:09:48Z","title":"FOLIO: Focused Semantic Memory for Streaming Video Understanding","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-02T05:40:48.277130Z"},"links":{"cited_paper":"/paper/2510.09608","citing_paper":"/paper/2607.13298"},"observation_digest":"sha256:3d670ca5883763c7c8ab8b691d4bcd13bebbf9c457e2a43777bd89e2b2b2ff3f","observation_id":"4aab3a6e-dce1-4db3-8ea6-e720f36e02c0","resolution":{"observed_at":"2026-08-02T05:40:48.277130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:40:48.354846Z","title":"RTV-bench: Benchmarking MLLM continuous per- ception, understanding and reasoning through real-time video","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.13298","last_updated":"2026-07-14T22:09:48Z","snapshot_observed_at":"2026-08-07T01:40:11.166031Z","submitted_at":"2026-07-14T22:09:48Z","title":"FOLIO: Focused Semantic Memory for Streaming Video Understanding","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-02T05:40:48.354846Z"},"links":{"citing_paper":"/paper/2607.13298"},"observation_digest":"sha256:061bf9ccafb4ec6fed28d15099057aa3d9047cd7bc3c5434575a13adbd6d3ad9","observation_id":"293e3802-b4f6-43b3-9d0b-d01a1a99fbb7","resolution":{"observed_at":"2026-08-02T05:40:48.354846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.15717","last_updated":"2025-08-21T16:56:29Z","snapshot_observed_at":"2026-08-18T16:22:02.091795Z","submitted_at":"2025-08-21T16:56:29Z","title":"StreamMem: Query-Agnostic KV Cache Memory for Streaming Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.15717","snapshot_observed_at":"2026-08-02T05:40:48.484251Z","title":"Streammem: Query-agnostic kv cache memory for streaming video understanding.arXiv preprint arXiv:2508.15717, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13298","last_updated":"2026-07-14T22:09:48Z","snapshot_observed_at":"2026-08-07T01:40:11.166031Z","submitted_at":"2026-07-14T22:09:48Z","title":"FOLIO: Focused Semantic Memory for Streaming Video Understanding","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-02T05:40:48.484251Z"},"links":{"cited_paper":"/paper/2508.15717","citing_paper":"/paper/2607.13298"},"observation_digest":"sha256:b07d4cb9da2b388353cf35b8442393da8244a9d2fa7adec86b48777b90049866","observation_id":"1ab9f8a5-2f51-45b5-8f2b-c11138fe01ea","resolution":{"observed_at":"2026-08-02T05:40:48.484251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:40:48.616626Z","title":"Svbench: A benchmark with temporal multi-turn dialogues for streaming video understanding.arXiv preprint arXiv:2502.10810, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13298","last_updated":"2026-07-14T22:09:48Z","snapshot_observed_at":"2026-08-07T01:40:11.166031Z","submitted_at":"2026-07-14T22:09:48Z","title":"FOLIO: Focused Semantic Memory for Streaming Video Understanding","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-02T05:40:48.616626Z"},"links":{"citing_paper":"/paper/2607.13298"},"observation_digest":"sha256:d439c3c64187a021d6d6e6ac60874d50612ab41ec52d63905b26edd1edde3fd9","observation_id":"ded4972f-d0b4-4d9b-8a7c-c283fb20302c","resolution":{"observed_at":"2026-08-02T05:40:48.616626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:40:48.860850Z","title":"Livestar: Live streaming assis- tant for real-world online video understanding.Advances in Neural Information Processing Systems, 38:31266–31304,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13298","last_updated":"2026-07-14T22:09:48Z","snapshot_observed_at":"2026-08-07T01:40:11.166031Z","submitted_at":"2026-07-14T22:09:48Z","title":"FOLIO: Focused Semantic Memory for Streaming Video Understanding","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-02T05:40:48.860850Z"},"links":{"citing_paper":"/paper/2607.13298"},"observation_digest":"sha256:2fcc390d96a890f8e550e2cac6183ec08ef80083c4f9b2dd31d6794c25c6389e","observation_id":"4b67abcb-9da9-4f3d-81ec-97d6128fec3a","resolution":{"observed_at":"2026-08-02T05:40:48.860850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:40:48.999512Z","title":"Timechat-online: 80% visual tokens are naturally redundant in streaming videos","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13298","last_updated":"2026-07-14T22:09:48Z","snapshot_observed_at":"2026-08-07T01:40:11.166031Z","submitted_at":"2026-07-14T22:09:48Z","title":"FOLIO: Focused Semantic Memory for Streaming Video Understanding","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-02T05:40:48.999512Z"},"links":{"citing_paper":"/paper/2607.13298"},"observation_digest":"sha256:4f45e6eeef452286718fcd62b84529125244690ef397bc73a547ba6aeed68940","observation_id":"f9e01330-bf06-451e-8948-e2acc84923db","resolution":{"observed_at":"2026-08-02T05:40:48.999512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:40:49.120572Z","title":"Worldmm: Dynamic multimodal memory agent for long video reasoning.arXiv preprint arXiv:2512.02425, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13298","last_updated":"2026-07-14T22:09:48Z","snapshot_observed_at":"2026-08-07T01:40:11.166031Z","submitted_at":"2026-07-14T22:09:48Z","title":"FOLIO: Focused Semantic Memory for Streaming Video Understanding","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-02T05:40:49.120572Z"},"links":{"citing_paper":"/paper/2607.13298"},"observation_digest":"sha256:4d0a3b1d4dfc73ea17d75312655301a030b26ed47b5f749ddb0ee2bafa9c7056","observation_id":"fdd4536e-f4ed-4293-a0a7-b36f408ff6a1","resolution":{"observed_at":"2026-08-02T05:40:49.120572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:40:49.196026Z","title":"Eyes wide open: Ego proactive video-llm for streaming video.Ad- vances in Neural Information Processing Systems, 38:13420– 13463, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.13298","last_updated":"2026-07-14T22:09:48Z","snapshot_observed_at":"2026-08-07T01:40:11.166031Z","submitted_at":"2026-07-14T22:09:48Z","title":"FOLIO: Focused Semantic Memory for Streaming Video Understanding","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-02T05:40:49.196026Z"},"links":{"citing_paper":"/paper/2607.13298"},"observation_digest":"sha256:ccbf1c802cf947363715a1485374f2e0e538145e8a895c98718682a1f9b692e6","observation_id":"7256dec1-32ac-4ed5-8a1f-c63ce8f90d1d","resolution":{"observed_at":"2026-08-02T05:40:49.196026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:40:49.276526Z","title":"Streamforest: Efficient online video understand- ing with persistent event memory.Advances in Neural In- formation Processing Systems, 38:75804–75835, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.13298","last_updated":"2026-07-14T22:09:48Z","snapshot_observed_at":"2026-08-07T01:40:11.166031Z","submitted_at":"2026-07-14T22:09:48Z","title":"FOLIO: Focused Semantic Memory for Streaming Video Understanding","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-02T05:40:49.276526Z"},"links":{"citing_paper":"/paper/2607.13298"},"observation_digest":"sha256:1d2baefb6f10cb8da71a98cadcb5e174bae954124337fd823ef667108d65354f","observation_id":"b4f971bb-7ccf-40b8-bb42-e8117f951dc3","resolution":{"observed_at":"2026-08-02T05:40:49.276526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:40:49.371480Z","title":"Video-llama: An instruction-tuned audio-visual language model for video un- derstanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13298","last_updated":"2026-07-14T22:09:48Z","snapshot_observed_at":"2026-08-07T01:40:11.166031Z","submitted_at":"2026-07-14T22:09:48Z","title":"FOLIO: Focused Semantic Memory for Streaming Video Understanding","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-02T05:40:49.371480Z"},"links":{"citing_paper":"/paper/2607.13298"},"observation_digest":"sha256:ba364f19f4e6f2e6ede396aed06a057422e5cb01acba4dcf058601de07224dd8","observation_id":"06b4bf85-672f-409a-b567-6da81f991a74","resolution":{"observed_at":"2026-08-02T05:40:49.371480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.14724","last_updated":"2026-05-07T12:10:26Z","snapshot_observed_at":"2026-08-19T22:56:20.379542Z","submitted_at":"2026-01-21T07:26:15Z","title":"HERMES: KV Cache as Hierarchical Memory for Efficient Streaming Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.14724","snapshot_observed_at":"2026-08-02T05:40:49.468513Z","title":"Hermes: Kv cache as hierarchical memory for efficient streaming video understanding.arXiv preprint arXiv:2601.14724, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.13298","last_updated":"2026-07-14T22:09:48Z","snapshot_observed_at":"2026-08-07T01:40:11.166031Z","submitted_at":"2026-07-14T22:09:48Z","title":"FOLIO: Focused Semantic Memory for Streaming Video Understanding","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-02T05:40:49.468513Z"},"links":{"cited_paper":"/paper/2601.14724","citing_paper":"/paper/2607.13298"},"observation_digest":"sha256:72ac54931ea8a1366fe697499cd4f956786d0af7a6427ed6c28a1d4aba7e4954","observation_id":"1fab58bf-3224-4412-add9-4d877e13272f","resolution":{"observed_at":"2026-08-02T05:40:49.468513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:40:49.547863Z","title":"Think-as-you-see: Stream- ing chain-of-thought reasoning for large vision-language mod- els.arXiv preprint arXiv:2603.02872, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.13298","last_updated":"2026-07-14T22:09:48Z","snapshot_observed_at":"2026-08-07T01:40:11.166031Z","submitted_at":"2026-07-14T22:09:48Z","title":"FOLIO: Focused Semantic Memory for Streaming Video Understanding","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-02T05:40:49.547863Z"},"links":{"citing_paper":"/paper/2607.13298"},"observation_digest":"sha256:98830c4dc47091e8f9fa7d0d9c51678059bde01c5b85624b4fce8728ffe14875","observation_id":"7114c5bc-4360-46a7-96e5-bb83427ff5ce","resolution":{"observed_at":"2026-08-02T05:40:49.547863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:40:49.659308Z","title":"Querystream: Advancing streaming video understanding with query-aware pruning and proactive response","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.13298","last_updated":"2026-07-14T22:09:48Z","snapshot_observed_at":"2026-08-07T01:40:11.166031Z","submitted_at":"2026-07-14T22:09:48Z","title":"FOLIO: Focused Semantic Memory for Streaming Video Understanding","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-02T05:40:49.659308Z"},"links":{"citing_paper":"/paper/2607.13298"},"observation_digest":"sha256:ec6e3cfdd079ae92f8aa1db6a8acd4e7461921c12ea5be88115b55669d7e826b","observation_id":"c18d68e3-480d-42f8-9acd-72c48b903cfc","resolution":{"observed_at":"2026-08-02T05:40:49.659308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09596","last_updated":"2024-12-12T18:58:30Z","snapshot_observed_at":"2026-08-12T23:49:37.475723Z","submitted_at":"2024-12-12T18:58:30Z","title":"InternLM-XComposer2.5-OmniLive: A Comprehensive Multimodal System for Long-term Streaming Video and Audio Interactions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09596","snapshot_observed_at":"2026-08-02T05:40:49.748388Z","title":"Internlm-xcomposer2","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13298","last_updated":"2026-07-14T22:09:48Z","snapshot_observed_at":"2026-08-07T01:40:11.166031Z","submitted_at":"2026-07-14T22:09:48Z","title":"FOLIO: Focused Semantic Memory for Streaming Video Understanding","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-02T05:40:49.748388Z"},"links":{"cited_paper":"/paper/2412.09596","citing_paper":"/paper/2607.13298"},"observation_digest":"sha256:c020f771c4d39d100c1f0b103812c572a4cdf3d908450735913e949972f444e3","observation_id":"c7153a65-386a-4160-b939-63be0ae1703d","resolution":{"observed_at":"2026-08-02T05:40:49.748388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-02T05:40:49.833950Z","title":"Long context transfer from language to vision.arXiv preprint arXiv:2406.16852, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13298","last_updated":"2026-07-14T22:09:48Z","snapshot_observed_at":"2026-08-07T01:40:11.166031Z","submitted_at":"2026-07-14T22:09:48Z","title":"FOLIO: Focused Semantic Memory for Streaming Video Understanding","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-02T05:40:49.833950Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2607.13298"},"observation_digest":"sha256:665dabbda802c33f8423d001fa2c6663d55a3306a45aaa178be1e8d2d5d192f7","observation_id":"a27eb059-6f72-4afd-b2c5-a86da28f5db7","resolution":{"observed_at":"2026-08-02T05:40:49.833950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02713","last_updated":"2025-08-01T16:40:14Z","snapshot_observed_at":"2026-08-19T14:11:01.412437Z","submitted_at":"2024-10-03T17:36:49Z","title":"LLaVA-Video: Video Instruction Tuning With Synthetic Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02713","snapshot_observed_at":"2026-08-02T05:40:49.930725Z","title":"Llava-video: Video instruction tuning with synthetic data.arXiv preprint arXiv:2410.02713, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13298","last_updated":"2026-07-14T22:09:48Z","snapshot_observed_at":"2026-08-07T01:40:11.166031Z","submitted_at":"2026-07-14T22:09:48Z","title":"FOLIO: Focused Semantic Memory for Streaming Video Understanding","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-02T05:40:49.930725Z"},"links":{"cited_paper":"/paper/2410.02713","citing_paper":"/paper/2607.13298"},"observation_digest":"sha256:6f462af0552b3dd2c28244f793a69deea2267b94763adbd23daa6bfd0c4b0ee9","observation_id":"809e9789-b714-4898-b197-2cda009b0a61","resolution":{"observed_at":"2026-08-02T05:40:49.930725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:40:50.012286Z","title":"Proactive assistant dialogue generation from streaming egocentric videos","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13298","last_updated":"2026-07-14T22:09:48Z","snapshot_observed_at":"2026-08-07T01:40:11.166031Z","submitted_at":"2026-07-14T22:09:48Z","title":"FOLIO: Focused Semantic Memory for Streaming Video Understanding","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-02T05:40:50.012286Z"},"links":{"citing_paper":"/paper/2607.13298"},"observation_digest":"sha256:d3cd8dca0a692d1b3b5dd733f5a7e0b21e0293b470f798500e0cbc94284434b9","observation_id":"95031e18-2fc1-4cc8-a19d-4d6ae93e4486","resolution":{"observed_at":"2026-08-02T05:40:50.012286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:40:50.124779Z","title":"Proactive assistant dialogue generation from streaming egocentric videos","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13298","last_updated":"2026-07-14T22:09:48Z","snapshot_observed_at":"2026-08-07T01:40:11.166031Z","submitted_at":"2026-07-14T22:09:48Z","title":"FOLIO: Focused Semantic Memory for Streaming Video Understanding","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-02T05:40:50.124779Z"},"links":{"citing_paper":"/paper/2607.13298"},"observation_digest":"sha256:c1a87fc49757f683ff451d38627a266c680a836336a76023cfdedd1df58de637","observation_id":"13383cae-d94a-463d-8591-6ad804ea5321","resolution":{"observed_at":"2026-08-02T05:40:50.124779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:40:50.208860Z","title":"Hierarchical event memory for accurate and low- latency online video temporal grounding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13298","last_updated":"2026-07-14T22:09:48Z","snapshot_observed_at":"2026-08-07T01:40:11.166031Z","submitted_at":"2026-07-14T22:09:48Z","title":"FOLIO: Focused Semantic Memory for Streaming Video Understanding","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-02T05:40:50.208860Z"},"links":{"citing_paper":"/paper/2607.13298"},"observation_digest":"sha256:709d08c56298f93fbcf59e7ddd6407a2a81978399c51dd8500d45265ca2dd3ce","observation_id":"d8576c91-72a3-41fb-8150-9c972abf6679","resolution":{"observed_at":"2026-08-02T05:40:50.208860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04264","last_updated":"2025-01-01T15:53:58Z","snapshot_observed_at":"2026-08-03T20:38:36.602554Z","submitted_at":"2024-06-06T17:09:32Z","title":"MLVU: Benchmarking Multi-task Long Video Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04264","snapshot_observed_at":"2026-08-02T05:40:50.290445Z","title":"recent” from “earlier","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13298","last_updated":"2026-07-14T22:09:48Z","snapshot_observed_at":"2026-08-07T01:40:11.166031Z","submitted_at":"2026-07-14T22:09:48Z","title":"FOLIO: Focused Semantic Memory for Streaming Video Understanding","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-02T05:40:50.290445Z"},"links":{"cited_paper":"/paper/2406.04264","citing_paper":"/paper/2607.13298"},"observation_digest":"sha256:9a017c63b0f01f754bc8cadeb4addcceef0eaef63e6311141519d31fd192dc00","observation_id":"48330fd9-008b-4fe8-ae01-535a18d86353","resolution":{"observed_at":"2026-08-02T05:40:50.290445Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:40:50.366425Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13298","last_updated":"2026-07-14T22:09:48Z","snapshot_observed_at":"2026-08-07T01:40:11.166031Z","submitted_at":"2026-07-14T22:09:48Z","title":"FOLIO: Focused Semantic Memory for Streaming Video Understanding","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-02T05:40:50.366425Z"},"links":{"citing_paper":"/paper/2607.13298"},"observation_digest":"sha256:c4139f0d504106eec1be9259fe54c183255fea2690e4166028ed7388d3ed2932","observation_id":"82d93ecf-9e6c-4778-af21-84326ec4c09f","resolution":{"observed_at":"2026-08-02T05:40:50.366425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:40:50.513581Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13298","last_updated":"2026-07-14T22:09:48Z","snapshot_observed_at":"2026-08-07T01:40:11.166031Z","submitted_at":"2026-07-14T22:09:48Z","title":"FOLIO: Focused Semantic Memory for Streaming Video Understanding","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-02T05:40:50.513581Z"},"links":{"citing_paper":"/paper/2607.13298"},"observation_digest":"sha256:75c8634f9085a4cf658799a14715dcfc0fa632d0583c28f102b7bc4bd89203f8","observation_id":"4069fdae-cf75-47e0-89c2-97ceb6a820c1","resolution":{"observed_at":"2026-08-02T05:40:50.513581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:40:50.635364Z","title":"Put them in compact_objects unless they are central to the action, then put them in detailed_objects","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13298","last_updated":"2026-07-14T22:09:48Z","snapshot_observed_at":"2026-08-07T01:40:11.166031Z","submitted_at":"2026-07-14T22:09:48Z","title":"FOLIO: Focused Semantic Memory for Streaming Video Understanding","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-02T05:40:50.635364Z"},"links":{"citing_paper":"/paper/2607.13298"},"observation_digest":"sha256:23a2383adc2adb10377daca52f3c7143c2242e06effd99468a152370405ab81b","observation_id":"c98fb03d-546b-45e7-9516-0b445e7f34e9","resolution":{"observed_at":"2026-08-02T05:40:50.635364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:40:50.741826Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13298","last_updated":"2026-07-14T22:09:48Z","snapshot_observed_at":"2026-08-07T01:40:11.166031Z","submitted_at":"2026-07-14T22:09:48Z","title":"FOLIO: Focused Semantic Memory for Streaming Video Understanding","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-02T05:40:50.741826Z"},"links":{"citing_paper":"/paper/2607.13298"},"observation_digest":"sha256:2acb0217c5c5d954a97cb21c35e5c66d81b87f9601845d58ab85005ef7b3a387","observation_id":"f2dec515-99bd-4cc7-ad51-458e468fc612","resolution":{"observed_at":"2026-08-02T05:40:50.741826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:40:50.833842Z","title":"time\": \"{start_time:.1f}-{end_time:.1f}s","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13298","last_updated":"2026-07-14T22:09:48Z","snapshot_observed_at":"2026-08-07T01:40:11.166031Z","submitted_at":"2026-07-14T22:09:48Z","title":"FOLIO: Focused Semantic Memory for Streaming Video Understanding","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-02T05:40:50.833842Z"},"links":{"citing_paper":"/paper/2607.13298"},"observation_digest":"sha256:b2772b38c828b80759fa61d96c3d79ebfba6f0fa21a24835ce261a6ad681e590","observation_id":"83608dcd-6269-4091-b55d-78d8a32d3788","resolution":{"observed_at":"2026-08-02T05:40:50.833842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:40:50.951018Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13298","last_updated":"2026-07-14T22:09:48Z","snapshot_observed_at":"2026-08-07T01:40:11.166031Z","submitted_at":"2026-07-14T22:09:48Z","title":"FOLIO: Focused Semantic Memory for Streaming Video Understanding","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-02T05:40:50.951018Z"},"links":{"citing_paper":"/paper/2607.13298"},"observation_digest":"sha256:2cf0ec9c52a91526764f803211e3ab20596d41e347caeb95787d6f1dab21867e","observation_id":"ffc1c6af-df20-4005-8c35-0f72d37fcb68","resolution":{"observed_at":"2026-08-02T05:40:50.951018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:40:51.064442Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13298","last_updated":"2026-07-14T22:09:48Z","snapshot_observed_at":"2026-08-07T01:40:11.166031Z","submitted_at":"2026-07-14T22:09:48Z","title":"FOLIO: Focused Semantic Memory for Streaming Video Understanding","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-02T05:40:51.064442Z"},"links":{"citing_paper":"/paper/2607.13298"},"observation_digest":"sha256:9885cea86edd2671fe418d2b6de5f78113b642536880739a03df1ebcca74b701","observation_id":"bc10390b-e87e-4a0c-ad50-e20eb6c7c966","resolution":{"observed_at":"2026-08-02T05:40:51.064442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:40:51.138752Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13298","last_updated":"2026-07-14T22:09:48Z","snapshot_observed_at":"2026-08-07T01:40:11.166031Z","submitted_at":"2026-07-14T22:09:48Z","title":"FOLIO: Focused Semantic Memory for Streaming Video Understanding","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-02T05:40:51.138752Z"},"links":{"citing_paper":"/paper/2607.13298"},"observation_digest":"sha256:47d9bcc159f366f154ea329fdb62fe99c24b48621999fa00d75e69d892c311f1","observation_id":"6464a1bf-3f1c-43af-aab1-153e931dcfdb","resolution":{"observed_at":"2026-08-02T05:40:51.138752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:40:51.282189Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13298","last_updated":"2026-07-14T22:09:48Z","snapshot_observed_at":"2026-08-07T01:40:11.166031Z","submitted_at":"2026-07-14T22:09:48Z","title":"FOLIO: Focused Semantic Memory for Streaming Video Understanding","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-02T05:40:51.282189Z"},"links":{"citing_paper":"/paper/2607.13298"},"observation_digest":"sha256:19f3291276e72aa4cce82ce3da908ba2e63e069bad74fac66e830de72ef4cb6f","observation_id":"79f02603-b715-4002-a1b3-f34bbcd06826","resolution":{"observed_at":"2026-08-02T05:40:51.282189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:40:51.395450Z","title":"avid reader","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13298","last_updated":"2026-07-14T22:09:48Z","snapshot_observed_at":"2026-08-07T01:40:11.166031Z","submitted_at":"2026-07-14T22:09:48Z","title":"FOLIO: Focused Semantic Memory for Streaming Video Understanding","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-02T05:40:51.395450Z"},"links":{"citing_paper":"/paper/2607.13298"},"observation_digest":"sha256:ab043a9a3ecc12f1af2a921a1b3e50e2efe1705e26b990c454359981ca221024","observation_id":"5435aa13-3c92-440d-a7ea-4a109c422fc1","resolution":{"observed_at":"2026-08-02T05:40:51.395450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:40:51.488681Z","title":"avid reader","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13298","last_updated":"2026-07-14T22:09:48Z","snapshot_observed_at":"2026-08-07T01:40:11.166031Z","submitted_at":"2026-07-14T22:09:48Z","title":"FOLIO: Focused Semantic Memory for Streaming Video Understanding","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-02T05:40:51.488681Z"},"links":{"citing_paper":"/paper/2607.13298"},"observation_digest":"sha256:4fa5417f688125c38824a0b246bcebbc03b100d2aa2a24d791d86df79efc8960","observation_id":"485f210d-02cb-4933-bf51-c5e92d47abe8","resolution":{"observed_at":"2026-08-02T05:40:51.488681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:40:51.563637Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13298","last_updated":"2026-07-14T22:09:48Z","snapshot_observed_at":"2026-08-07T01:40:11.166031Z","submitted_at":"2026-07-14T22:09:48Z","title":"FOLIO: Focused Semantic Memory for Streaming Video Understanding","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-02T05:40:51.563637Z"},"links":{"citing_paper":"/paper/2607.13298"},"observation_digest":"sha256:81473aa43322347fb1d13b6056a6bf38c3e692a2f7e115c8d27211d16da9c022","observation_id":"f802922a-0e17-406d-8103-77b0793b7d95","resolution":{"observed_at":"2026-08-02T05:40:51.563637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:40:51.617908Z","title":"relevant_object_ids","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13298","last_updated":"2026-07-14T22:09:48Z","snapshot_observed_at":"2026-08-07T01:40:11.166031Z","submitted_at":"2026-07-14T22:09:48Z","title":"FOLIO: Focused Semantic Memory for Streaming Video Understanding","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-02T05:40:51.617908Z"},"links":{"citing_paper":"/paper/2607.13298"},"observation_digest":"sha256:e33c8de83d389f933fdc315555640b018096a31210646701e09a5186c439317e","observation_id":"8f667726-c5b7-4891-9258-58b38841f508","resolution":{"observed_at":"2026-08-02T05:40:51.617908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:40:51.727831Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13298","last_updated":"2026-07-14T22:09:48Z","snapshot_observed_at":"2026-08-07T01:40:11.166031Z","submitted_at":"2026-07-14T22:09:48Z","title":"FOLIO: Focused Semantic Memory for Streaming Video Understanding","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-02T05:40:51.727831Z"},"links":{"citing_paper":"/paper/2607.13298"},"observation_digest":"sha256:d874f3ba10e12e7a5b5c45e0d38a04ca10616fa29b7fdb08b9f8afdca597632c","observation_id":"4e65542d-9431-493c-9ca0-ed74aeebb15d","resolution":{"observed_at":"2026-08-02T05:40:51.727831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:40:51.790099Z","title":"## (!) CONCEPT QUESTION -- SPECIAL HANDLING REQUIRED","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13298","last_updated":"2026-07-14T22:09:48Z","snapshot_observed_at":"2026-08-07T01:40:11.166031Z","submitted_at":"2026-07-14T22:09:48Z","title":"FOLIO: Focused Semantic Memory for Streaming Video Understanding","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-02T05:40:51.790099Z"},"links":{"citing_paper":"/paper/2607.13298"},"observation_digest":"sha256:41e87cc5889a712c0d42d46f133ee25e570c961383768d065f51847ccd916e13","observation_id":"b3009591-3b80-42e2-b8a2-0e75e1f18968","resolution":{"observed_at":"2026-08-02T05:40:51.790099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:40:51.856126Z","title":"Recent frames inform CURRENT state only","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13298","last_updated":"2026-07-14T22:09:48Z","snapshot_observed_at":"2026-08-07T01:40:11.166031Z","submitted_at":"2026-07-14T22:09:48Z","title":"FOLIO: Focused Semantic Memory for Streaming Video Understanding","version":1},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-08-02T05:40:51.856126Z"},"links":{"citing_paper":"/paper/2607.13298"},"observation_digest":"sha256:4ff53ef87e4e7525b5c05baf2b47af41ec6927bcfe90280ba1f8dbb7902cbf22","observation_id":"2328a109-6093-4c42-81ac-12da28d09b51","resolution":{"observed_at":"2026-08-02T05:40:51.856126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.13298","last_updated":"2026-07-14T22:09:48Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T01:40:11.166031Z","submitted_at":"2026-07-14T22:09:48Z","title":"FOLIO: Focused Semantic Memory for Streaming Video Understanding"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":99,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":109},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 100 of 109 outbound references and 0 inbound Pith citation observations for arXiv:2607.13298."}