{"as_of":"2026-08-16T22:59:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:02b6af0ebc6df60265ecafd0f0c8e7146cb201aafad5cb2b7697801c061f7711","coverage":[{"denominator":84,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":84,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-11T06:35:35.951554Z","state":"measured"},{"denominator":84,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":84,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.05511/citation-record","integrity":"/paper/2607.05511/integrity","json":"/paper/2607.05511/citation-record.json","paper":"/paper/2607.05511"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T06:35:35.951554Z","title":"Divprune: Diversity-based visual token pruning for large multimodal models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05511","last_updated":"2026-07-06T18:00:06Z","snapshot_observed_at":"2026-08-12T23:50:27.205160Z","submitted_at":"2026-07-06T18:00:06Z","title":"Light-Omni: Reflex over Reasoning in Agentic Video Understanding with Long-Term Memory","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-11T06:35:35.951554Z"},"links":{"citing_paper":"/paper/2607.05511"},"observation_digest":"sha256:b33605c62a5a56274a7044a82adfe14f949f2f2d26fdca5cd584ef0dea7f0504","observation_id":"62672d45-c23c-4752-9eae-ec76034ce17e","resolution":{"observed_at":"2026-07-11T06:35:35.951554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-08-11T14:42:37.584016Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-07-11T06:35:35.951554Z","title":"Qwen3-vl technical report.arXiv preprint arXiv:2511.21631, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05511","last_updated":"2026-07-06T18:00:06Z","snapshot_observed_at":"2026-08-12T23:50:27.205160Z","submitted_at":"2026-07-06T18:00:06Z","title":"Light-Omni: Reflex over Reasoning in Agentic Video Understanding with Long-Term Memory","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-11T06:35:35.951554Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2607.05511"},"observation_digest":"sha256:a0ee253272cad2956b75b6c68fe478de8a63b63a41ad09945dd67a6c0a0fe499","observation_id":"dab0d0fc-88a4-46a2-af4d-d20863049450","resolution":{"observed_at":"2026-07-11T06:35:35.951554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-14T04:17:22.593941Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-07-11T06:35:35.951554Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05511","last_updated":"2026-07-06T18:00:06Z","snapshot_observed_at":"2026-08-12T23:50:27.205160Z","submitted_at":"2026-07-06T18:00:06Z","title":"Light-Omni: Reflex over Reasoning in Agentic Video Understanding with Long-Term Memory","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-11T06:35:35.951554Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2607.05511"},"observation_digest":"sha256:3b106331286380d2c9f9f4ac0d85660c726c3a4746b5e1c7a74ddce78e21f304","observation_id":"5146e940-62d3-4c59-afde-8c1dd2f34eb2","resolution":{"observed_at":"2026-07-11T06:35:35.951554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T06:35:35.951554Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.05511","last_updated":"2026-07-06T18:00:06Z","snapshot_observed_at":"2026-08-12T23:50:27.205160Z","submitted_at":"2026-07-06T18:00:06Z","title":"Light-Omni: Reflex over Reasoning in Agentic Video Understanding with Long-Term Memory","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-11T06:35:35.951554Z"},"links":{"citing_paper":"/paper/2607.05511"},"observation_digest":"sha256:888fb4725b960edc2f1a2b2d68a9a552c7086df1c086d25c130408668d3e702c","observation_id":"bc75092b-e619-4831-aaa9-945f3a9f5a81","resolution":{"observed_at":"2026-07-11T06:35:35.951554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00610","last_updated":"2024-03-31T08:58:54Z","snapshot_observed_at":"2026-08-16T14:04:53.635805Z","submitted_at":"2024-03-31T08:58:54Z","title":"RQ-RAG: Learning to Refine Queries for Retrieval Augmented Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00610","snapshot_observed_at":"2026-07-11T06:35:35.951554Z","title":"Rq-rag: Learning to refine queries for retrieval augmented generation.arXiv preprint arXiv:2404.00610, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05511","last_updated":"2026-07-06T18:00:06Z","snapshot_observed_at":"2026-08-12T23:50:27.205160Z","submitted_at":"2026-07-06T18:00:06Z","title":"Light-Omni: Reflex over Reasoning in Agentic Video Understanding with Long-Term Memory","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-11T06:35:35.951554Z"},"links":{"cited_paper":"/paper/2404.00610","citing_paper":"/paper/2607.05511"},"observation_digest":"sha256:a66656ae519661fd43dc22eadab34be0498d95f03032b4b00b7882d4560a11b5","observation_id":"6a00934d-ce71-440f-9e2e-6096ad1886b8","resolution":{"observed_at":"2026-07-11T06:35:35.951554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T06:35:35.951554Z","title":"Videollm-online: Online video large language model for streaming video","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05511","last_updated":"2026-07-06T18:00:06Z","snapshot_observed_at":"2026-08-12T23:50:27.205160Z","submitted_at":"2026-07-06T18:00:06Z","title":"Light-Omni: Reflex over Reasoning in Agentic Video Understanding with Long-Term Memory","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-11T06:35:35.951554Z"},"links":{"citing_paper":"/paper/2607.05511"},"observation_digest":"sha256:6139f82d321133b7748a52ec4f46a1b7446e029cf00ff5421da5eae1c2bcdfaf","observation_id":"7aa3831f-e15e-4af6-add8-e3fa0d89939c","resolution":{"observed_at":"2026-07-11T06:35:35.951554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T06:35:35.951554Z","title":"Evolu- tion and prospects of foundation models: From large language models to large multimodal models.Computers, Materials & Continua, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05511","last_updated":"2026-07-06T18:00:06Z","snapshot_observed_at":"2026-08-12T23:50:27.205160Z","submitted_at":"2026-07-06T18:00:06Z","title":"Light-Omni: Reflex over Reasoning in Agentic Video Understanding with Long-Term Memory","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-11T06:35:35.951554Z"},"links":{"citing_paper":"/paper/2607.05511"},"observation_digest":"sha256:cf89b5beaaa4fe3c571f27f3828d558c6a229300c93849b9de8370dae6a4171c","observation_id":"5443cf27-56aa-424f-9173-d9c0f3f5f4a3","resolution":{"observed_at":"2026-07-11T06:35:35.951554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-07-11T06:35:35.951554Z","title":"Gemini 2.5: Pushing the frontier with advanced reasoning, multimodality, long con- text, and next generation agentic capabilities.arXiv preprint arXiv:2507.06261, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05511","last_updated":"2026-07-06T18:00:06Z","snapshot_observed_at":"2026-08-12T23:50:27.205160Z","submitted_at":"2026-07-06T18:00:06Z","title":"Light-Omni: Reflex over Reasoning in Agentic Video Understanding with Long-Term Memory","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-11T06:35:35.951554Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2607.05511"},"observation_digest":"sha256:69164c0da6f6b6ef2af843d16b5dca91d41d97bdb14d5970f2c4ddab043edeac","observation_id":"75fbbff3-62b7-4321-8216-7128d6be1762","resolution":{"observed_at":"2026-07-11T06:35:35.951554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05407","last_updated":"2024-07-09T07:42:51Z","snapshot_observed_at":"2026-08-10T17:49:50.848957Z","submitted_at":"2024-07-07T15:16:19Z","title":"CosyVoice: A Scalable Multilingual Zero-shot Text-to-speech Synthesizer based on Supervised Semantic Tokens","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05407","snapshot_observed_at":"2026-07-11T06:35:35.951554Z","title":"Cosyvoice: A scalable multilingual zero-shot text- to-speech synthesizer based on supervised semantic tokens","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05511","last_updated":"2026-07-06T18:00:06Z","snapshot_observed_at":"2026-08-12T23:50:27.205160Z","submitted_at":"2026-07-06T18:00:06Z","title":"Light-Omni: Reflex over Reasoning in Agentic Video Understanding with Long-Term Memory","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-11T06:35:35.951554Z"},"links":{"cited_paper":"/paper/2407.05407","citing_paper":"/paper/2607.05511"},"observation_digest":"sha256:e52755af94826f24da97549d71e415628c3a42f3aca74133f7b1a49ad22b257c","observation_id":"b6e6f2bd-e1a2-4c44-ad29-e4f7f888d1df","resolution":{"observed_at":"2026-07-11T06:35:35.951554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T06:35:35.951554Z","title":"Video-mme: The first-ever comprehensive evaluation benchmark of multi-modal llms in video analysis","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05511","last_updated":"2026-07-06T18:00:06Z","snapshot_observed_at":"2026-08-12T23:50:27.205160Z","submitted_at":"2026-07-06T18:00:06Z","title":"Light-Omni: Reflex over Reasoning in Agentic Video Understanding with Long-Term Memory","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-11T06:35:35.951554Z"},"links":{"citing_paper":"/paper/2607.05511"},"observation_digest":"sha256:b7a2cb918e878775d445fe68b5611d991ae5e282604473522df7d9a064efef28","observation_id":"6b6285e5-c991-44ee-a181-601117e5c866","resolution":{"observed_at":"2026-07-11T06:35:35.951554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T06:35:35.951554Z","title":"Cognitive neuroscience of human memory","venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2607.05511","last_updated":"2026-07-06T18:00:06Z","snapshot_observed_at":"2026-08-12T23:50:27.205160Z","submitted_at":"2026-07-06T18:00:06Z","title":"Light-Omni: Reflex over Reasoning in Agentic Video Understanding with Long-Term Memory","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-11T06:35:35.951554Z"},"links":{"citing_paper":"/paper/2607.05511"},"observation_digest":"sha256:b729e3cdf8e1dc0617e3cb73eaa18abaac8a8c90cbeb55231754f8bb04cce39c","observation_id":"3b5b7a37-fafe-4b82-b6d4-aabdd1f5206f","resolution":{"observed_at":"2026-07-11T06:35:35.951554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T06:35:35.951554Z","title":"Precise zero-shot dense retrieval without relevance labels","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.05511","last_updated":"2026-07-06T18:00:06Z","snapshot_observed_at":"2026-08-12T23:50:27.205160Z","submitted_at":"2026-07-06T18:00:06Z","title":"Light-Omni: Reflex over Reasoning in Agentic Video Understanding with Long-Term Memory","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-11T06:35:35.951554Z"},"links":{"citing_paper":"/paper/2607.05511"},"observation_digest":"sha256:9e32bdb817683c07e3d655d1866b5be01d872a0b34dc8731435fc2d7b07c6907","observation_id":"1d057b8d-ade9-427b-bf6f-a690f774a868","resolution":{"observed_at":"2026-07-11T06:35:35.951554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T06:35:35.951554Z","title":"Nolan’s memento, memory, and recognition","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2607.05511","last_updated":"2026-07-06T18:00:06Z","snapshot_observed_at":"2026-08-12T23:50:27.205160Z","submitted_at":"2026-07-06T18:00:06Z","title":"Light-Omni: Reflex over Reasoning in Agentic Video Understanding with Long-Term Memory","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-11T06:35:35.951554Z"},"links":{"citing_paper":"/paper/2607.05511"},"observation_digest":"sha256:9c5ed4011e5daba4de888804e053f6798e52084b09438c066992f75c3e29927b","observation_id":"85996997-cd90-4adc-80b3-0f4e93a8c8a1","resolution":{"observed_at":"2026-07-11T06:35:35.951554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05779","last_updated":"2025-04-28T17:36:27Z","snapshot_observed_at":"2026-08-11T13:00:45.634760Z","submitted_at":"2024-10-08T08:00:12Z","title":"LightRAG: Simple and Fast Retrieval-Augmented Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05779","snapshot_observed_at":"2026-07-11T06:35:35.951554Z","title":"Lightrag: Simple and fast retrieval-augmented gener- ation.arXiv preprint arXiv:2410.05779, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05511","last_updated":"2026-07-06T18:00:06Z","snapshot_observed_at":"2026-08-12T23:50:27.205160Z","submitted_at":"2026-07-06T18:00:06Z","title":"Light-Omni: Reflex over Reasoning in Agentic Video Understanding with Long-Term Memory","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-11T06:35:35.951554Z"},"links":{"cited_paper":"/paper/2410.05779","citing_paper":"/paper/2607.05511"},"observation_digest":"sha256:de1e9237ac65e8353fb5516de243a24d222b1eb7b02fa4c06e72fb30dd6f5f4a","observation_id":"4eeeb659-7cb0-4ec7-8f6c-9da3b5a010ba","resolution":{"observed_at":"2026-07-11T06:35:35.951554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12837","last_updated":"2024-10-03T22:29:47Z","snapshot_observed_at":"2026-08-16T13:12:46.081601Z","submitted_at":"2024-10-03T22:29:47Z","title":"A Comprehensive Survey of Retrieval-Augmented Generation (RAG): Evolution, Current Landscape and Future Directions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.12837","snapshot_observed_at":"2026-07-11T06:35:35.951554Z","title":"A comprehensive survey of retrieval-augmented generation (rag): Evolution, current landscape and future directions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05511","last_updated":"2026-07-06T18:00:06Z","snapshot_observed_at":"2026-08-12T23:50:27.205160Z","submitted_at":"2026-07-06T18:00:06Z","title":"Light-Omni: Reflex over Reasoning in Agentic Video Understanding with Long-Term Memory","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-11T06:35:35.951554Z"},"links":{"cited_paper":"/paper/2410.12837","citing_paper":"/paper/2607.05511"},"observation_digest":"sha256:ddac937caa3726edd9c70cbd8baec7d1de1a5d23755879573a1b4e70df99a7d8","observation_id":"265d03eb-5414-402a-8d5a-4a3069fc9c00","resolution":{"observed_at":"2026-07-11T06:35:35.951554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06769","last_updated":"2025-11-03T00:53:34Z","snapshot_observed_at":"2026-08-15T20:23:25.637230Z","submitted_at":"2024-12-09T18:55:56Z","title":"Training Large Language Models to Reason in a Continuous Latent Space","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06769","snapshot_observed_at":"2026-07-11T06:35:35.951554Z","title":"Training large lan- guage models to reason in a continuous latent space.arXiv preprint arXiv:2412.06769, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05511","last_updated":"2026-07-06T18:00:06Z","snapshot_observed_at":"2026-08-12T23:50:27.205160Z","submitted_at":"2026-07-06T18:00:06Z","title":"Light-Omni: Reflex over Reasoning in Agentic Video Understanding with Long-Term Memory","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-11T06:35:35.951554Z"},"links":{"cited_paper":"/paper/2412.06769","citing_paper":"/paper/2607.05511"},"observation_digest":"sha256:c9c550a6a6d2954dd8800b485a686ac288236a1766f539682aa89b2d92f88d94","observation_id":"091533fe-3307-4d12-8895-ab01da3cc0f6","resolution":{"observed_at":"2026-07-11T06:35:35.951554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T06:35:35.951554Z","title":"Memory matters: The need to improve long-term memory in llm-agents","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.05511","last_updated":"2026-07-06T18:00:06Z","snapshot_observed_at":"2026-08-12T23:50:27.205160Z","submitted_at":"2026-07-06T18:00:06Z","title":"Light-Omni: Reflex over Reasoning in Agentic Video Understanding with Long-Term Memory","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-11T06:35:35.951554Z"},"links":{"citing_paper":"/paper/2607.05511"},"observation_digest":"sha256:098d50ffdfd45e13494869aa3e808a2207cbd73bdc83d0a0aaa47ec0c57a9f07","observation_id":"27437fa9-26e2-4c0b-98f4-7d382455f4f5","resolution":{"observed_at":"2026-07-11T06:35:35.951554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T06:35:35.951554Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.05511","last_updated":"2026-07-06T18:00:06Z","snapshot_observed_at":"2026-08-12T23:50:27.205160Z","submitted_at":"2026-07-06T18:00:06Z","title":"Light-Omni: Reflex over Reasoning in Agentic Video Understanding with Long-Term Memory","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-11T06:35:35.951554Z"},"links":{"citing_paper":"/paper/2607.05511"},"observation_digest":"sha256:39ee061f10b68ff4da0c6feed9acefbbd4a7337dea80c0d2bddf9c43b7675d02","observation_id":"0c060234-fa88-48c5-a12a-04017b7af36f","resolution":{"observed_at":"2026-07-11T06:35:35.951554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.13564","last_updated":"2026-01-13T09:33:57Z","snapshot_observed_at":"2026-08-13T14:23:02.090859Z","submitted_at":"2025-12-15T17:22:34Z","title":"Memory in the Age of AI Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.13564","snapshot_observed_at":"2026-07-11T06:35:35.951554Z","title":"Memory in the age of ai agents.arXiv preprint arXiv:2512.13564, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05511","last_updated":"2026-07-06T18:00:06Z","snapshot_observed_at":"2026-08-12T23:50:27.205160Z","submitted_at":"2026-07-06T18:00:06Z","title":"Light-Omni: Reflex over Reasoning in Agentic Video Understanding with Long-Term Memory","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-11T06:35:35.951554Z"},"links":{"cited_paper":"/paper/2512.13564","citing_paper":"/paper/2607.05511"},"observation_digest":"sha256:3a113da44a219c50b6fd0c03ffde87532f65dba5095b564db1063cdae5245ca6","observation_id":"8e31f9f7-2e08-4443-a6f8-010e72c3ae4d","resolution":{"observed_at":"2026-07-11T06:35:35.951554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-08-15T14:02:47.366139Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-07-11T06:35:35.951554Z","title":"Gpt-4o system card.arXiv preprint arXiv:2410.21276, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05511","last_updated":"2026-07-06T18:00:06Z","snapshot_observed_at":"2026-08-12T23:50:27.205160Z","submitted_at":"2026-07-06T18:00:06Z","title":"Light-Omni: Reflex over Reasoning in Agentic Video Understanding with Long-Term Memory","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-11T06:35:35.951554Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2607.05511"},"observation_digest":"sha256:587fc76adfa85fba51de2aac9579ad41876f073baba294734f34eeff9203dc6a","observation_id":"09ecfeb4-d601-4f22-99b2-7322645c7484","resolution":{"observed_at":"2026-07-11T06:35:35.951554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T06:35:35.951554Z","title":"Memory-based augmen- tation network for video captioning.IEEE Transactions on Multimedia, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.05511","last_updated":"2026-07-06T18:00:06Z","snapshot_observed_at":"2026-08-12T23:50:27.205160Z","submitted_at":"2026-07-06T18:00:06Z","title":"Light-Omni: Reflex over Reasoning in Agentic Video Understanding with Long-Term Memory","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-11T06:35:35.951554Z"},"links":{"citing_paper":"/paper/2607.05511"},"observation_digest":"sha256:420a9a946cb6ad60d177dae38a63d11cb281104d0a9e173d77cc04f3187dbe28","observation_id":"01de7b5d-8e58-4617-9529-746fb463ab43","resolution":{"observed_at":"2026-07-11T06:35:35.951554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T06:35:35.951554Z","title":"Billion-scale similarity search with gpus.IEEE Transactions on Big Data, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.05511","last_updated":"2026-07-06T18:00:06Z","snapshot_observed_at":"2026-08-12T23:50:27.205160Z","submitted_at":"2026-07-06T18:00:06Z","title":"Light-Omni: Reflex over Reasoning in Agentic Video Understanding with Long-Term Memory","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-11T06:35:35.951554Z"},"links":{"citing_paper":"/paper/2607.05511"},"observation_digest":"sha256:34198c1385c884f8c57a4606f3270aa04bda9a2a61c3fa0fc4699877e4e605a3","observation_id":"da36919f-eb16-4d0a-8f4f-ac8d0a3185fb","resolution":{"observed_at":"2026-07-11T06:35:35.951554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T06:35:35.951554Z","title":"Thinking, fast and slow.Farrar, Straus and Giroux, 2011","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2607.05511","last_updated":"2026-07-06T18:00:06Z","snapshot_observed_at":"2026-08-12T23:50:27.205160Z","submitted_at":"2026-07-06T18:00:06Z","title":"Light-Omni: Reflex over Reasoning in Agentic Video Understanding with Long-Term Memory","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-11T06:35:35.951554Z"},"links":{"citing_paper":"/paper/2607.05511"},"observation_digest":"sha256:24237f38cb73ef54d01b7e8b722aa855349c97db245a923d7f122b622201eaa0","observation_id":"d3c0b1a9-b1bb-427a-9883-f97c75755dba","resolution":{"observed_at":"2026-07-11T06:35:35.951554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.06326","last_updated":"2025-05-30T15:36:51Z","snapshot_observed_at":"2026-08-14T17:20:40.849177Z","submitted_at":"2025-05-30T15:36:51Z","title":"Memory OS of AI Agent","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.06326","snapshot_observed_at":"2026-07-11T06:35:35.951554Z","title":"Mem- ory os of ai agent.arXiv preprint arXiv:2506.06326, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05511","last_updated":"2026-07-06T18:00:06Z","snapshot_observed_at":"2026-08-12T23:50:27.205160Z","submitted_at":"2026-07-06T18:00:06Z","title":"Light-Omni: Reflex over Reasoning in Agentic Video Understanding with Long-Term Memory","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-11T06:35:35.951554Z"},"links":{"cited_paper":"/paper/2506.06326","citing_paper":"/paper/2607.05511"},"observation_digest":"sha256:3bd9348ca7e2e2ffbba64fb6d67e79c9aeeff1dba6e4b3d2aa02aba41deaa042","observation_id":"1d95d7f6-8ed1-46c7-83c8-8e0013df56c9","resolution":{"observed_at":"2026-07-11T06:35:35.951554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T06:35:35.951554Z","title":"Infinipot-v: Memory-constrained kv cache com- pression for streaming video understanding.arXiv preprint arXiv:2506.15745, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05511","last_updated":"2026-07-06T18:00:06Z","snapshot_observed_at":"2026-08-12T23:50:27.205160Z","submitted_at":"2026-07-06T18:00:06Z","title":"Light-Omni: Reflex over Reasoning in Agentic Video Understanding with Long-Term Memory","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-11T06:35:35.951554Z"},"links":{"citing_paper":"/paper/2607.05511"},"observation_digest":"sha256:c13dc0491b702d8d295a82f102665c9e5fe207c7adcdf521fda58a57999f0848","observation_id":"17eac659-4e0f-464e-b36a-c05a7910fcea","resolution":{"observed_at":"2026-07-11T06:35:35.951554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T06:35:35.951554Z","title":"Hippomm: Hippocampal-inspired mul- timodal memory for long audiovisual event understanding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05511","last_updated":"2026-07-06T18:00:06Z","snapshot_observed_at":"2026-08-12T23:50:27.205160Z","submitted_at":"2026-07-06T18:00:06Z","title":"Light-Omni: Reflex over Reasoning in Agentic Video Understanding with Long-Term Memory","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-11T06:35:35.951554Z"},"links":{"citing_paper":"/paper/2607.05511"},"observation_digest":"sha256:23aa4debae8971b67610c44d28e333e39d223452914adc9fa0f16f153b61cf15","observation_id":"0bcd0299-a3f3-42be-812a-8b3a2b3ac780","resolution":{"observed_at":"2026-07-11T06:35:35.951554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T06:35:35.951554Z","title":"Longvideoagent: Multi-agent rea- soning with long videos.arXiv preprint arXiv:2512.20618, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05511","last_updated":"2026-07-06T18:00:06Z","snapshot_observed_at":"2026-08-12T23:50:27.205160Z","submitted_at":"2026-07-06T18:00:06Z","title":"Light-Omni: Reflex over Reasoning in Agentic Video Understanding with Long-Term Memory","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-11T06:35:35.951554Z"},"links":{"citing_paper":"/paper/2607.05511"},"observation_digest":"sha256:c35cb2fa420cfa50b24c0de79d2559ef57ebaa4841bbda48992eab5538f3ca0b","observation_id":"fb6d234f-a3f1-484d-a5b3-a709f54daa8e","resolution":{"observed_at":"2026-07-11T06:35:35.951554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01671","last_updated":"2025-08-15T05:01:34Z","snapshot_observed_at":"2026-08-16T13:13:18.115217Z","submitted_at":"2024-10-02T15:39:55Z","title":"Bridging Context Gaps: Leveraging Coreference Resolution for Long Contextual Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.01671","snapshot_observed_at":"2026-07-11T06:35:35.951554Z","title":"Bridging context gaps: Leveraging coref- erence resolution for long contextual understanding.arXiv preprint arXiv:2410.01671, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05511","last_updated":"2026-07-06T18:00:06Z","snapshot_observed_at":"2026-08-12T23:50:27.205160Z","submitted_at":"2026-07-06T18:00:06Z","title":"Light-Omni: Reflex over Reasoning in Agentic Video Understanding with Long-Term Memory","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-11T06:35:35.951554Z"},"links":{"cited_paper":"/paper/2410.01671","citing_paper":"/paper/2607.05511"},"observation_digest":"sha256:d5ee248bd6da5e854c8d7338bbdd3b765cdb036736392437ca36fb70b7d14c5b","observation_id":"8a470679-c450-4e3e-ab23-bcb6c06e0284","resolution":{"observed_at":"2026-07-11T06:35:35.951554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T06:35:35.951554Z","title":"Seeing, listening, remem- bering, and reasoning: A multimodal agent with long-term memory","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.05511","last_updated":"2026-07-06T18:00:06Z","snapshot_observed_at":"2026-08-12T23:50:27.205160Z","submitted_at":"2026-07-06T18:00:06Z","title":"Light-Omni: Reflex over Reasoning in Agentic Video Understanding with Long-Term Memory","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-11T06:35:35.951554Z"},"links":{"citing_paper":"/paper/2607.05511"},"observation_digest":"sha256:557a165b5f08c70c531723f2166617ddcc03a8112e2fbea63fd9527880e6e84d","observation_id":"63f86692-310e-417a-ac46-312c230c4519","resolution":{"observed_at":"2026-07-11T06:35:35.951554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T06:35:35.951554Z","title":"Video-rag: Visually-aligned retrieval-augmented long video comprehension.arXiv preprint arXiv:2411.13093, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05511","last_updated":"2026-07-06T18:00:06Z","snapshot_observed_at":"2026-08-12T23:50:27.205160Z","submitted_at":"2026-07-06T18:00:06Z","title":"Light-Omni: Reflex over Reasoning in Agentic Video Understanding with Long-Term Memory","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-11T06:35:35.951554Z"},"links":{"citing_paper":"/paper/2607.05511"},"observation_digest":"sha256:f366a3ccc388b87a156a443fce6042847f25820c2578d6bea74b97ad9382e513","observation_id":"c625bd29-0dac-4ac1-9675-2ff0aab208c6","resolution":{"observed_at":"2026-07-11T06:35:35.951554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T06:35:35.951554Z","title":"Query rewriting in retrieval-augmented large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.05511","last_updated":"2026-07-06T18:00:06Z","snapshot_observed_at":"2026-08-12T23:50:27.205160Z","submitted_at":"2026-07-06T18:00:06Z","title":"Light-Omni: Reflex over Reasoning in Agentic Video Understanding with Long-Term Memory","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-11T06:35:35.951554Z"},"links":{"citing_paper":"/paper/2607.05511"},"observation_digest":"sha256:e1734dfb7af5faf18b02041825cc0e9937ec760027cce48438579874cf1f333e","observation_id":"f3e8300f-8ee8-4886-ab2a-23d9e7d2ec9e","resolution":{"observed_at":"2026-07-11T06:35:35.951554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T06:35:35.951554Z","title":"Personavlm: Long-term personalized multi- modal llms","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.05511","last_updated":"2026-07-06T18:00:06Z","snapshot_observed_at":"2026-08-12T23:50:27.205160Z","submitted_at":"2026-07-06T18:00:06Z","title":"Light-Omni: Reflex over Reasoning in Agentic Video Understanding with Long-Term Memory","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-11T06:35:35.951554Z"},"links":{"citing_paper":"/paper/2607.05511"},"observation_digest":"sha256:93b086397c703c085f84c3edb7e86dc1b60b7784696c575e656e44b1a9471122","observation_id":"86ecdb6c-4c47-4c2f-a0ba-9a8d7faf08b0","resolution":{"observed_at":"2026-07-11T06:35:35.951554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T06:35:35.951554Z","title":"Ovo-bench: How far is your video-llms from real-world online video understanding? InCVPR, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05511","last_updated":"2026-07-06T18:00:06Z","snapshot_observed_at":"2026-08-12T23:50:27.205160Z","submitted_at":"2026-07-06T18:00:06Z","title":"Light-Omni: Reflex over Reasoning in Agentic Video Understanding with Long-Term Memory","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-11T06:35:35.951554Z"},"links":{"citing_paper":"/paper/2607.05511"},"observation_digest":"sha256:7cf03ffc9bea265ef75ffb39905294b31298e9b3c212784cc0f4bf43c9668ce2","observation_id":"e7214e01-9233-41e0-892a-3e475b2e39e6","resolution":{"observed_at":"2026-07-11T06:35:35.951554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T06:35:35.951554Z","title":"Dispider: Enabling video llms with active real-time interaction via dis- entangled perception, decision, and reaction","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05511","last_updated":"2026-07-06T18:00:06Z","snapshot_observed_at":"2026-08-12T23:50:27.205160Z","submitted_at":"2026-07-06T18:00:06Z","title":"Light-Omni: Reflex over Reasoning in Agentic Video Understanding with Long-Term Memory","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-11T06:35:35.951554Z"},"links":{"citing_paper":"/paper/2607.05511"},"observation_digest":"sha256:8d953ae983decd088c7bbd59abfa4b65c2d013ae63ff1788693f3466b65f996c","observation_id":"982d1acf-c076-4bfd-93ae-526bfc4586a6","resolution":{"observed_at":"2026-07-11T06:35:35.951554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.03267","last_updated":"2026-05-01T23:55:43Z","snapshot_observed_at":"2026-08-15T00:17:32.875866Z","submitted_at":"2025-12-19T07:05:38Z","title":"OpenAI GPT-5 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.03267","snapshot_observed_at":"2026-07-11T06:35:35.951554Z","title":"Openai gpt-5 system card.arXiv preprint arXiv:2601.03267, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05511","last_updated":"2026-07-06T18:00:06Z","snapshot_observed_at":"2026-08-12T23:50:27.205160Z","submitted_at":"2026-07-06T18:00:06Z","title":"Light-Omni: Reflex over Reasoning in Agentic Video Understanding with Long-Term Memory","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-11T06:35:35.951554Z"},"links":{"cited_paper":"/paper/2601.03267","citing_paper":"/paper/2607.05511"},"observation_digest":"sha256:024992122cede167897711f2bac7aa06fb9ada23e6b07d6c0061b63cd4904df7","observation_id":"192f0c48-19f2-49cc-a4bf-6d40b6cd5a7f","resolution":{"observed_at":"2026-07-11T06:35:35.951554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T06:35:35.951554Z","title":"Moviechat: From dense token to sparse memory for long video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05511","last_updated":"2026-07-06T18:00:06Z","snapshot_observed_at":"2026-08-12T23:50:27.205160Z","submitted_at":"2026-07-06T18:00:06Z","title":"Light-Omni: Reflex over Reasoning in Agentic Video Understanding with Long-Term Memory","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-11T06:35:35.951554Z"},"links":{"citing_paper":"/paper/2607.05511"},"observation_digest":"sha256:0f22a60a3b6672423785cf764573f316d353aa8b53d0f2637a87864155f1ced5","observation_id":"cc4b6225-c547-4c13-af6c-3c2ef687d11c","resolution":{"observed_at":"2026-07-11T06:35:35.951554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T06:35:35.951554Z","title":"Adaptive keyframe sampling for long video understanding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05511","last_updated":"2026-07-06T18:00:06Z","snapshot_observed_at":"2026-08-12T23:50:27.205160Z","submitted_at":"2026-07-06T18:00:06Z","title":"Light-Omni: Reflex over Reasoning in Agentic Video Understanding with Long-Term Memory","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-11T06:35:35.951554Z"},"links":{"citing_paper":"/paper/2607.05511"},"observation_digest":"sha256:1262935b91324967219f16af37d0a6cca6e1806ab7830c6cd4af5a6bcb4bd0fd","observation_id":"c22616a1-fc0a-4965-8053-184283b99bb6","resolution":{"observed_at":"2026-07-11T06:35:35.951554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T06:35:35.951554Z","title":"Omniagent: Audio-guided active percep- tion agent for omnimodal audio-video understanding.arXiv preprint arXiv:2512.23646, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05511","last_updated":"2026-07-06T18:00:06Z","snapshot_observed_at":"2026-08-12T23:50:27.205160Z","submitted_at":"2026-07-06T18:00:06Z","title":"Light-Omni: Reflex over Reasoning in Agentic Video Understanding with Long-Term Memory","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-11T06:35:35.951554Z"},"links":{"citing_paper":"/paper/2607.05511"},"observation_digest":"sha256:7a1cd1188a025c613066b5fd979c4bc379bf49b9971fcf1f6801c8008c59b781","observation_id":"c21c4173-a003-4600-909b-963f5cbe3ed3","resolution":{"observed_at":"2026-07-11T06:35:35.951554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-08-14T18:15:53.516440Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-07-11T06:35:35.951554Z","title":"Gemini 1.5: Unlocking mul- timodal understanding across millions of tokens of context","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05511","last_updated":"2026-07-06T18:00:06Z","snapshot_observed_at":"2026-08-12T23:50:27.205160Z","submitted_at":"2026-07-06T18:00:06Z","title":"Light-Omni: Reflex over Reasoning in Agentic Video Understanding with Long-Term Memory","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-11T06:35:35.951554Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2607.05511"},"observation_digest":"sha256:b73df2e5809621232fa27a4ed499f41f6a219d654e0fb166869a386659d4ff07","observation_id":"0329e12c-d1eb-4139-bdb7-f328cc82dde4","resolution":{"observed_at":"2026-07-11T06:35:35.951554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T06:35:35.951554Z","title":"Silero vad: pre-trained enterprise-grade voice ac- tivity detector (vad), number detector and language classifier","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05511","last_updated":"2026-07-06T18:00:06Z","snapshot_observed_at":"2026-08-12T23:50:27.205160Z","submitted_at":"2026-07-06T18:00:06Z","title":"Light-Omni: Reflex over Reasoning in Agentic Video Understanding with Long-Term Memory","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-11T06:35:35.951554Z"},"links":{"citing_paper":"/paper/2607.05511"},"observation_digest":"sha256:bf1e1dc8d1dd582fb82a581d5945e2a7cfeac240a11dedb026ff36e4977e1979","observation_id":"6c4663bf-96d6-41cf-aa55-da7e2738d133","resolution":{"observed_at":"2026-07-11T06:35:35.951554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-15T03:29:11.892997Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.13654","snapshot_observed_at":"2026-07-11T06:35:35.951554Z","title":"Ego-r1: Chain-of-tool- thought for ultra-long egocentric video reasoning.arXiv preprint arXiv:2506.13654, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05511","last_updated":"2026-07-06T18:00:06Z","snapshot_observed_at":"2026-08-12T23:50:27.205160Z","submitted_at":"2026-07-06T18:00:06Z","title":"Light-Omni: Reflex over Reasoning in Agentic Video Understanding with Long-Term Memory","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-11T06:35:35.951554Z"},"links":{"cited_paper":"/paper/2506.13654","citing_paper":"/paper/2607.05511"},"observation_digest":"sha256:acb37d678f1b00cc005767e232c43eefbc367ba716317fe6a2a742ed22f3fa5a","observation_id":"b3a46354-b2c7-4b15-b292-0dad84c0b2ac","resolution":{"observed_at":"2026-07-11T06:35:35.951554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T06:35:35.951554Z","title":"Lvbench: An extreme long video understanding benchmark","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05511","last_updated":"2026-07-06T18:00:06Z","snapshot_observed_at":"2026-08-12T23:50:27.205160Z","submitted_at":"2026-07-06T18:00:06Z","title":"Light-Omni: Reflex over Reasoning in Agentic Video Understanding with Long-Term Memory","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-11T06:35:35.951554Z"},"links":{"citing_paper":"/paper/2607.05511"},"observation_digest":"sha256:fdd7c2cc63c53d55990c6dd785bd77139935bed4869d64a4b73b3cf208e7ed31","observation_id":"902e21c7-0eb5-43fe-801a-e76b89254ae0","resolution":{"observed_at":"2026-07-11T06:35:35.951554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T06:35:35.951554Z","title":"Videoagent: Long-form video understanding with large language model as agent","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05511","last_updated":"2026-07-06T18:00:06Z","snapshot_observed_at":"2026-08-12T23:50:27.205160Z","submitted_at":"2026-07-06T18:00:06Z","title":"Light-Omni: Reflex over Reasoning in Agentic Video Understanding with Long-Term Memory","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-11T06:35:35.951554Z"},"links":{"citing_paper":"/paper/2607.05511"},"observation_digest":"sha256:22f35859a2ce65c8d255ceb9cb9d07d4c352849d2f934c2dc414927d5fc7d92e","observation_id":"7406fb19-f47a-44df-9376-963b00e49b4a","resolution":{"observed_at":"2026-07-11T06:35:35.951554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.00592","last_updated":"2025-05-30T14:40:56Z","snapshot_observed_at":"2026-08-15T21:25:52.230059Z","submitted_at":"2025-02-01T23:13:10Z","title":"M+: Extending MemoryLLM with Scalable Long-Term Memory","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.00592","snapshot_observed_at":"2026-07-11T06:35:35.951554Z","title":"M+: Extending memoryllm with scalable long-term memory.arXiv preprint arXiv:2502.00592, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05511","last_updated":"2026-07-06T18:00:06Z","snapshot_observed_at":"2026-08-12T23:50:27.205160Z","submitted_at":"2026-07-06T18:00:06Z","title":"Light-Omni: Reflex over Reasoning in Agentic Video Understanding with Long-Term Memory","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-11T06:35:35.951554Z"},"links":{"cited_paper":"/paper/2502.00592","citing_paper":"/paper/2607.05511"},"observation_digest":"sha256:51bcbb483dfa81de8b5903f03eb4b233a9250059941c0f166a3447ffe815d0e6","observation_id":"1d245945-05f6-4355-81c8-c49e74c8e8dd","resolution":{"observed_at":"2026-07-11T06:35:35.951554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T06:35:35.951554Z","title":"Next-gpt: Any-to-any multimodal llm","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05511","last_updated":"2026-07-06T18:00:06Z","snapshot_observed_at":"2026-08-12T23:50:27.205160Z","submitted_at":"2026-07-06T18:00:06Z","title":"Light-Omni: Reflex over Reasoning in Agentic Video Understanding with Long-Term Memory","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-11T06:35:35.951554Z"},"links":{"citing_paper":"/paper/2607.05511"},"observation_digest":"sha256:384c8c482832970b9bdb445bfe02c205e85d15410ceae798cd213c0bad078cd7","observation_id":"64006f58-d511-45b9-90d5-8fd646c244f0","resolution":{"observed_at":"2026-07-11T06:35:35.951554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17453","last_updated":"2024-04-07T00:56:53Z","snapshot_observed_at":"2026-08-14T06:01:54.549199Z","submitted_at":"2023-09-29T17:59:56Z","title":"Efficient Streaming Language Models with Attention Sinks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17453","snapshot_observed_at":"2026-07-11T06:35:35.951554Z","title":"Efficient streaming language models with attention sinks.arXiv preprint arXiv:2309.17453, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.05511","last_updated":"2026-07-06T18:00:06Z","snapshot_observed_at":"2026-08-12T23:50:27.205160Z","submitted_at":"2026-07-06T18:00:06Z","title":"Light-Omni: Reflex over Reasoning in Agentic Video Understanding with Long-Term Memory","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-11T06:35:35.951554Z"},"links":{"cited_paper":"/paper/2309.17453","citing_paper":"/paper/2607.05511"},"observation_digest":"sha256:0a7d70c56aa7741a68ddbd086a1220bfa2b664e0a7e012f7f2bf60d10c039680","observation_id":"a3089d27-949d-49f5-bd3a-b1bde2f81563","resolution":{"observed_at":"2026-07-11T06:35:35.951554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20215","last_updated":"2025-03-26T04:17:55Z","snapshot_observed_at":"2026-08-06T08:46:20.194739Z","submitted_at":"2025-03-26T04:17:55Z","title":"Qwen2.5-Omni Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20215","snapshot_observed_at":"2026-07-11T06:35:35.951554Z","title":"Qwen2.5-omni technical report.arXiv preprint arXiv:2503.20215, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05511","last_updated":"2026-07-06T18:00:06Z","snapshot_observed_at":"2026-08-12T23:50:27.205160Z","submitted_at":"2026-07-06T18:00:06Z","title":"Light-Omni: Reflex over Reasoning in Agentic Video Understanding with Long-Term Memory","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-11T06:35:35.951554Z"},"links":{"cited_paper":"/paper/2503.20215","citing_paper":"/paper/2607.05511"},"observation_digest":"sha256:ddc7fee0929477b1736a38f16f22a5e301748b70029f787ceb9cb6c78f3f753f","observation_id":"13cd17e4-ca50-4c89-98f0-cea38c07362c","resolution":{"observed_at":"2026-07-11T06:35:35.951554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.17765","last_updated":"2025-09-22T13:26:24Z","snapshot_observed_at":"2026-08-11T00:14:34.061687Z","submitted_at":"2025-09-22T13:26:24Z","title":"Qwen3-Omni Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.17765","snapshot_observed_at":"2026-07-11T06:35:35.951554Z","title":"Qwen3-omni technical report.arXiv preprint arXiv:2509.17765, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05511","last_updated":"2026-07-06T18:00:06Z","snapshot_observed_at":"2026-08-12T23:50:27.205160Z","submitted_at":"2026-07-06T18:00:06Z","title":"Light-Omni: Reflex over Reasoning in Agentic Video Understanding with Long-Term Memory","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-11T06:35:35.951554Z"},"links":{"cited_paper":"/paper/2509.17765","citing_paper":"/paper/2607.05511"},"observation_digest":"sha256:35cfb519ffe71253c8628acc11e82e0fb9e101d00289f510775f46ca12cf3fe3","observation_id":"75d9643b-8920-4bdb-8cbb-0b6d93d295ae","resolution":{"observed_at":"2026-07-11T06:35:35.951554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T06:35:35.951554Z","title":"Long video understanding with learnable retrieval in video-language models.IEEE Transactions on Multimedia, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.05511","last_updated":"2026-07-06T18:00:06Z","snapshot_observed_at":"2026-08-12T23:50:27.205160Z","submitted_at":"2026-07-06T18:00:06Z","title":"Light-Omni: Reflex over Reasoning in Agentic Video Understanding with Long-Term Memory","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-11T06:35:35.951554Z"},"links":{"citing_paper":"/paper/2607.05511"},"observation_digest":"sha256:f494a3d2346da510252a179e7684572dbb94c43780d546d278a9ec17a10d7649","observation_id":"55f7aa16-6a36-46ab-84de-4a0764401df5","resolution":{"observed_at":"2026-07-11T06:35:35.951554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12110","last_updated":"2025-10-08T01:46:37Z","snapshot_observed_at":"2026-08-03T02:27:06.991396Z","submitted_at":"2025-02-17T18:36:14Z","title":"A-MEM: Agentic Memory for LLM Agents","version":11},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12110","snapshot_observed_at":"2026-07-11T06:35:35.951554Z","title":"A-mem: Agentic memory for llm agents.arXiv preprint arXiv:2502.12110, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05511","last_updated":"2026-07-06T18:00:06Z","snapshot_observed_at":"2026-08-12T23:50:27.205160Z","submitted_at":"2026-07-06T18:00:06Z","title":"Light-Omni: Reflex over Reasoning in Agentic Video Understanding with Long-Term Memory","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-11T06:35:35.951554Z"},"links":{"cited_paper":"/paper/2502.12110","citing_paper":"/paper/2607.05511"},"observation_digest":"sha256:388b314cc7871935cbd91a558831992ac01dbaf7c626d6361deafd961a8a5280","observation_id":"87b8b910-a964-473c-aa4e-3de2bcb67aa1","resolution":{"observed_at":"2026-07-11T06:35:35.951554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-11T06:35:35.951554Z","title":"Qwen3 technical report.arXiv preprint arXiv:2505.09388, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05511","last_updated":"2026-07-06T18:00:06Z","snapshot_observed_at":"2026-08-12T23:50:27.205160Z","submitted_at":"2026-07-06T18:00:06Z","title":"Light-Omni: Reflex over Reasoning in Agentic Video Understanding with Long-Term Memory","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-11T06:35:35.951554Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2607.05511"},"observation_digest":"sha256:65c5ac2635a0b03b96d159533fcce65c8c041e4018a5a2793f633e9981ff46eb","observation_id":"86020176-262f-4a16-b432-67f019cbcf3a","resolution":{"observed_at":"2026-07-11T06:35:35.951554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T06:35:35.951554Z","title":"Worldmm: Dynamic multimodal memory agent for long video reasoning","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.05511","last_updated":"2026-07-06T18:00:06Z","snapshot_observed_at":"2026-08-12T23:50:27.205160Z","submitted_at":"2026-07-06T18:00:06Z","title":"Light-Omni: Reflex over Reasoning in Agentic Video Understanding with Long-Term Memory","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-07-11T06:35:35.951554Z"},"links":{"citing_paper":"/paper/2607.05511"},"observation_digest":"sha256:b6bf5ef7ebce26be9a32b7963b47bfb0e4ecb9de1a00ab7cc2683e52114ec767","observation_id":"60559c67-4224-44ce-ba0d-894366637ba3","resolution":{"observed_at":"2026-07-11T06:35:35.951554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08085","last_updated":"2024-06-30T05:39:46Z","snapshot_observed_at":"2026-08-16T13:43:48.910620Z","submitted_at":"2024-06-12T11:07:55Z","title":"Flash-VStream: Memory-Based Real-Time Understanding for Long Video Streams","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08085","snapshot_observed_at":"2026-07-11T06:35:35.951554Z","title":"Flash-vstream: Memory- based real-time understanding for long video streams.arXiv preprint arXiv:2406.08085, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05511","last_updated":"2026-07-06T18:00:06Z","snapshot_observed_at":"2026-08-12T23:50:27.205160Z","submitted_at":"2026-07-06T18:00:06Z","title":"Light-Omni: Reflex over Reasoning in Agentic Video Understanding with Long-Term Memory","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-07-11T06:35:35.951554Z"},"links":{"cited_paper":"/paper/2406.08085","citing_paper":"/paper/2607.05511"},"observation_digest":"sha256:301508e754e48adb4e62394fba5762aee67ad98d62065213182972cdf1f0e2b8","observation_id":"97a1906b-585e-4bfb-9a68-31c654f7fd22","resolution":{"observed_at":"2026-07-11T06:35:35.951554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.04416","last_updated":"2025-09-03T07:11:03Z","snapshot_observed_at":"2026-08-16T19:19:24.035883Z","submitted_at":"2025-08-06T13:03:21Z","title":"Thinking With Videos: Multimodal Tool-Augmented Reinforcement Learning for Long Video Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.04416","snapshot_observed_at":"2026-07-11T06:35:35.951554Z","title":"Thinking with videos: Multimodal tool- augmented reinforcement learning for long video reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05511","last_updated":"2026-07-06T18:00:06Z","snapshot_observed_at":"2026-08-12T23:50:27.205160Z","submitted_at":"2026-07-06T18:00:06Z","title":"Light-Omni: Reflex over Reasoning in Agentic Video Understanding with Long-Term Memory","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-07-11T06:35:35.951554Z"},"links":{"cited_paper":"/paper/2508.04416","citing_paper":"/paper/2607.05511"},"observation_digest":"sha256:a07d0a1160128b05c92c9a10292e734f0d75f5d6d3ff0901f1241535597ec0ac","observation_id":"2d72fa15-8089-477a-bab5-02b19d16776e","resolution":{"observed_at":"2026-07-11T06:35:35.951554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09596","last_updated":"2024-12-12T18:58:30Z","snapshot_observed_at":"2026-08-12T23:49:37.475723Z","submitted_at":"2024-12-12T18:58:30Z","title":"InternLM-XComposer2.5-OmniLive: A Comprehensive Multimodal System for Long-term Streaming Video and Audio Interactions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09596","snapshot_observed_at":"2026-07-11T06:35:35.951554Z","title":"Internlm-xcomposer2","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05511","last_updated":"2026-07-06T18:00:06Z","snapshot_observed_at":"2026-08-12T23:50:27.205160Z","submitted_at":"2026-07-06T18:00:06Z","title":"Light-Omni: Reflex over Reasoning in Agentic Video Understanding with Long-Term Memory","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-07-11T06:35:35.951554Z"},"links":{"cited_paper":"/paper/2412.09596","citing_paper":"/paper/2607.05511"},"observation_digest":"sha256:6db8b64f801ad12df5d72e41814f4a89a3af746f562f6f0589f6e9769613afd0","observation_id":"a25e7ef2-4c1f-492c-8e1e-295760706f59","resolution":{"observed_at":"2026-07-11T06:35:35.951554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-15T22:21:58.999807Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.13642","snapshot_observed_at":"2026-07-11T06:35:35.951554Z","title":"Stream-omni: Simultaneous multimodal interac- tions with large language-vision-speech model.arXiv preprint arXiv:2506.13642, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05511","last_updated":"2026-07-06T18:00:06Z","snapshot_observed_at":"2026-08-12T23:50:27.205160Z","submitted_at":"2026-07-06T18:00:06Z","title":"Light-Omni: Reflex over Reasoning in Agentic Video Understanding with Long-Term Memory","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-07-11T06:35:35.951554Z"},"links":{"cited_paper":"/paper/2506.13642","citing_paper":"/paper/2607.05511"},"observation_digest":"sha256:c680811856ecb719fddbfa077774c01e44a3e500e540b4a34f60762932c3422d","observation_id":"f28a4588-daff-4cac-8c3e-8020f4f57764","resolution":{"observed_at":"2026-07-11T06:35:35.951554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T06:35:35.951554Z","title":"Deep video discovery: Agentic search with tool use for long-form video understanding.arXiv preprint arXiv:2505.18079, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05511","last_updated":"2026-07-06T18:00:06Z","snapshot_observed_at":"2026-08-12T23:50:27.205160Z","submitted_at":"2026-07-06T18:00:06Z","title":"Light-Omni: Reflex over Reasoning in Agentic Video Understanding with Long-Term Memory","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-07-11T06:35:35.951554Z"},"links":{"citing_paper":"/paper/2607.05511"},"observation_digest":"sha256:c1929c042c5fd36768902f30ade02f3cfcac56950477486044da9fc1166c4179","observation_id":"48e703a0-ec1c-4d91-bdda-bdc2f5d4e4ad","resolution":{"observed_at":"2026-07-11T06:35:35.951554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05176","last_updated":"2025-06-11T02:54:49Z","snapshot_observed_at":"2026-08-15T22:44:59.368534Z","submitted_at":"2025-06-05T15:49:48Z","title":"Qwen3 Embedding: Advancing Text Embedding and Reranking Through Foundation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.05176","snapshot_observed_at":"2026-07-11T06:35:35.951554Z","title":"Qwen3 embedding: Advancing text embedding and reranking through foundation models.arXiv preprint arXiv:2506.05176, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05511","last_updated":"2026-07-06T18:00:06Z","snapshot_observed_at":"2026-08-12T23:50:27.205160Z","submitted_at":"2026-07-06T18:00:06Z","title":"Light-Omni: Reflex over Reasoning in Agentic Video Understanding with Long-Term Memory","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-07-11T06:35:35.951554Z"},"links":{"cited_paper":"/paper/2506.05176","citing_paper":"/paper/2607.05511"},"observation_digest":"sha256:d9980f38c9d46a326bb80836d50e62b9ce23bc5d76cf3bf23b45b84f2664ee02","observation_id":"57c70409-0795-4371-a064-596e811cbeb4","resolution":{"observed_at":"2026-07-11T06:35:35.951554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T06:35:35.951554Z","title":"Retrieval-augmented generation for ai- generated content: A survey.Data Science and Engineering, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.05511","last_updated":"2026-07-06T18:00:06Z","snapshot_observed_at":"2026-08-12T23:50:27.205160Z","submitted_at":"2026-07-06T18:00:06Z","title":"Light-Omni: Reflex over Reasoning in Agentic Video Understanding with Long-Term Memory","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-07-11T06:35:35.951554Z"},"links":{"citing_paper":"/paper/2607.05511"},"observation_digest":"sha256:c4dfe24e63e2a6d495fc57fdc0a6c28c0368f263cdb63280aa8dcefa0eb38492","observation_id":"1bc77360-64ac-45b2-8beb-01c78f749091","resolution":{"observed_at":"2026-07-11T06:35:35.951554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.14924","last_updated":"2024-09-23T11:20:20Z","snapshot_observed_at":"2026-08-16T13:16:18.351948Z","submitted_at":"2024-09-23T11:20:20Z","title":"Retrieval Augmented Generation (RAG) and Beyond: A Comprehensive Survey on How to Make your LLMs use External Data More Wisely","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.14924","snapshot_observed_at":"2026-07-11T06:35:35.951554Z","title":"Retrieval augmented generation (rag) and beyond: A comprehensive survey on how to make your llms use external data more wisely.arXiv preprint arXiv:2409.14924, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05511","last_updated":"2026-07-06T18:00:06Z","snapshot_observed_at":"2026-08-12T23:50:27.205160Z","submitted_at":"2026-07-06T18:00:06Z","title":"Light-Omni: Reflex over Reasoning in Agentic Video Understanding with Long-Term Memory","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-07-11T06:35:35.951554Z"},"links":{"cited_paper":"/paper/2409.14924","citing_paper":"/paper/2607.05511"},"observation_digest":"sha256:7fb9f5a8c78a7f43875f169dfd7324e20cfccc52fc27bac856f7820e3c073f8a","observation_id":"ea10d174-fde9-49a5-8004-a51fb32c5b8e","resolution":{"observed_at":"2026-07-11T06:35:35.951554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T06:35:35.951554Z","title":"Memorybank: Enhancing large language models with long-term memory","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05511","last_updated":"2026-07-06T18:00:06Z","snapshot_observed_at":"2026-08-12T23:50:27.205160Z","submitted_at":"2026-07-06T18:00:06Z","title":"Light-Omni: Reflex over Reasoning in Agentic Video Understanding with Long-Term Memory","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-07-11T06:35:35.951554Z"},"links":{"citing_paper":"/paper/2607.05511"},"observation_digest":"sha256:2f625f2e5fb52ae633335c2107885449cf8931cc8c6f05b2cd1b693349acaab7","observation_id":"9f0a49d0-4b38-4c3c-a116-e3749b52bbba","resolution":{"observed_at":"2026-07-11T06:35:35.951554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10102","last_updated":"2026-05-16T07:15:07Z","snapshot_observed_at":"2026-08-04T19:12:49.508911Z","submitted_at":"2024-09-16T09:06:44Z","title":"Trustworthiness in Retrieval-Augmented Generation Systems: A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.10102","snapshot_observed_at":"2026-07-11T06:35:35.951554Z","title":"[start_timestamp]-[end_timestamp]: content","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05511","last_updated":"2026-07-06T18:00:06Z","snapshot_observed_at":"2026-08-12T23:50:27.205160Z","submitted_at":"2026-07-06T18:00:06Z","title":"Light-Omni: Reflex over Reasoning in Agentic Video Understanding with Long-Term Memory","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-07-11T06:35:35.951554Z"},"links":{"cited_paper":"/paper/2409.10102","citing_paper":"/paper/2607.05511"},"observation_digest":"sha256:79a21c9449e3700962d3ab8335784d3b38175bf8faf71397097057a43c1f9beb","observation_id":"d9a8e3b0-9c75-4145-ab14-0d619c58feac","resolution":{"observed_at":"2026-07-11T06:35:35.951554Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T06:35:35.951554Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05511","last_updated":"2026-07-06T18:00:06Z","snapshot_observed_at":"2026-08-12T23:50:27.205160Z","submitted_at":"2026-07-06T18:00:06Z","title":"Light-Omni: Reflex over Reasoning in Agentic Video Understanding with Long-Term Memory","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-07-11T06:35:35.951554Z"},"links":{"citing_paper":"/paper/2607.05511"},"observation_digest":"sha256:c983bc63389d67124237d02215672d56eacb2bc26b5838a7345e1f716dd53ac3","observation_id":"751d3085-7783-4f0e-a143-7d270c2c4cf3","resolution":{"observed_at":"2026-07-11T06:35:35.951554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T06:35:35.951554Z","title":"- If Global Memory exists: Describe only CHANGES and NEW ACTIONS","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05511","last_updated":"2026-07-06T18:00:06Z","snapshot_observed_at":"2026-08-12T23:50:27.205160Z","submitted_at":"2026-07-06T18:00:06Z","title":"Light-Omni: Reflex over Reasoning in Agentic Video Understanding with Long-Term Memory","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-07-11T06:35:35.951554Z"},"links":{"citing_paper":"/paper/2607.05511"},"observation_digest":"sha256:9953065d17c59e782ff6421632116ad9d5167d1058509f0b4fb25a018f8aba3a","observation_id":"1b117e5c-951c-41c4-8d72-d55088ee52f4","resolution":{"observed_at":"2026-07-11T06:35:35.951554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T06:35:35.951554Z","title":"- Note vocal tone and significant environmental sounds","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05511","last_updated":"2026-07-06T18:00:06Z","snapshot_observed_at":"2026-08-12T23:50:27.205160Z","submitted_at":"2026-07-06T18:00:06Z","title":"Light-Omni: Reflex over Reasoning in Agentic Video Understanding with Long-Term Memory","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-07-11T06:35:35.951554Z"},"links":{"citing_paper":"/paper/2607.05511"},"observation_digest":"sha256:ad1b639a1ed3e7a9ec7bdb44c11480b29f97124ca167d2b12e01766cb2a60659","observation_id":"86032933-954e-4971-a46e-a09291b5f4a7","resolution":{"observed_at":"2026-07-11T06:35:35.951554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T06:35:35.951554Z","title":"visual\":","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05511","last_updated":"2026-07-06T18:00:06Z","snapshot_observed_at":"2026-08-12T23:50:27.205160Z","submitted_at":"2026-07-06T18:00:06Z","title":"Light-Omni: Reflex over Reasoning in Agentic Video Understanding with Long-Term Memory","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-07-11T06:35:35.951554Z"},"links":{"citing_paper":"/paper/2607.05511"},"observation_digest":"sha256:d5e96d9b0e6fcfcbacd672ff53459cd562beb63e991e443b73cabf32243d2dea","observation_id":"48484edf-bddd-416f-94ec-29d2c185320d","resolution":{"observed_at":"2026-07-11T06:35:35.951554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T06:35:35.951554Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05511","last_updated":"2026-07-06T18:00:06Z","snapshot_observed_at":"2026-08-12T23:50:27.205160Z","submitted_at":"2026-07-06T18:00:06Z","title":"Light-Omni: Reflex over Reasoning in Agentic Video Understanding with Long-Term Memory","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-07-11T06:35:35.951554Z"},"links":{"citing_paper":"/paper/2607.05511"},"observation_digest":"sha256:fe8de492a7e1dd1a8ef2954a01d3e98ece1ad038c17028e1331d37baec9eb35d","observation_id":"2db1026b-d230-4aba-8355-aae8d58d0ab0","resolution":{"observed_at":"2026-07-11T06:35:35.951554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T06:35:35.951554Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05511","last_updated":"2026-07-06T18:00:06Z","snapshot_observed_at":"2026-08-12T23:50:27.205160Z","submitted_at":"2026-07-06T18:00:06Z","title":"Light-Omni: Reflex over Reasoning in Agentic Video Understanding with Long-Term Memory","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-07-11T06:35:35.951554Z"},"links":{"citing_paper":"/paper/2607.05511"},"observation_digest":"sha256:d0bcf3360457d6c7a5ecb5cae9f89a30c0c280b3f938b95cb9e68922747f0398","observation_id":"ec488e90-3dad-4b4a-81d1-42600e3c24dc","resolution":{"observed_at":"2026-07-11T06:35:35.951554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T06:35:35.951554Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05511","last_updated":"2026-07-06T18:00:06Z","snapshot_observed_at":"2026-08-12T23:50:27.205160Z","submitted_at":"2026-07-06T18:00:06Z","title":"Light-Omni: Reflex over Reasoning in Agentic Video Understanding with Long-Term Memory","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-07-11T06:35:35.951554Z"},"links":{"citing_paper":"/paper/2607.05511"},"observation_digest":"sha256:c836d028aac7fc4ac5a8b70ec3f417b40af4224f15844a60cc92dee9183ccb39","observation_id":"ec163ab8-1278-4ebd-870b-362505b7a192","resolution":{"observed_at":"2026-07-11T06:35:35.951554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T06:35:35.951554Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05511","last_updated":"2026-07-06T18:00:06Z","snapshot_observed_at":"2026-08-12T23:50:27.205160Z","submitted_at":"2026-07-06T18:00:06Z","title":"Light-Omni: Reflex over Reasoning in Agentic Video Understanding with Long-Term Memory","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-07-11T06:35:35.951554Z"},"links":{"citing_paper":"/paper/2607.05511"},"observation_digest":"sha256:bb28a4b6faba4e4fc4d76162b9d8067f31a05eae57d7c7abb0662a29577ac466","observation_id":"78555f57-55eb-4789-a706-eb08a4a2cd71","resolution":{"observed_at":"2026-07-11T06:35:35.951554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T06:35:35.951554Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05511","last_updated":"2026-07-06T18:00:06Z","snapshot_observed_at":"2026-08-12T23:50:27.205160Z","submitted_at":"2026-07-06T18:00:06Z","title":"Light-Omni: Reflex over Reasoning in Agentic Video Understanding with Long-Term Memory","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-07-11T06:35:35.951554Z"},"links":{"citing_paper":"/paper/2607.05511"},"observation_digest":"sha256:c398e87f5d7431c64a3917d73cf119ef22c28aff1c30f1236df9f4a32f51ffd8","observation_id":"3eff333d-4c6b-4b50-8a8b-1d13b95a5079","resolution":{"observed_at":"2026-07-11T06:35:35.951554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T06:35:35.951554Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05511","last_updated":"2026-07-06T18:00:06Z","snapshot_observed_at":"2026-08-12T23:50:27.205160Z","submitted_at":"2026-07-06T18:00:06Z","title":"Light-Omni: Reflex over Reasoning in Agentic Video Understanding with Long-Term Memory","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-07-11T06:35:35.951554Z"},"links":{"citing_paper":"/paper/2607.05511"},"observation_digest":"sha256:4c8bea6a2d0e7ef0763cb621e77c90794c50160c1521873fbd236aba0f7c31cd","observation_id":"f264af1a-7a53-467e-a3fe-66531bd88ce7","resolution":{"observed_at":"2026-07-11T06:35:35.951554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T06:35:35.951554Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05511","last_updated":"2026-07-06T18:00:06Z","snapshot_observed_at":"2026-08-12T23:50:27.205160Z","submitted_at":"2026-07-06T18:00:06Z","title":"Light-Omni: Reflex over Reasoning in Agentic Video Understanding with Long-Term Memory","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-07-11T06:35:35.951554Z"},"links":{"citing_paper":"/paper/2607.05511"},"observation_digest":"sha256:ed583298c560690f855c0dc167cf1ad7be191ccd4f8bc341ffc19cab1acad430","observation_id":"5845a427-a7a4-41b8-b1bc-07860972dfb3","resolution":{"observed_at":"2026-07-11T06:35:35.951554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T06:35:35.951554Z","title":"Figure 13","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05511","last_updated":"2026-07-06T18:00:06Z","snapshot_observed_at":"2026-08-12T23:50:27.205160Z","submitted_at":"2026-07-06T18:00:06Z","title":"Light-Omni: Reflex over Reasoning in Agentic Video Understanding with Long-Term Memory","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-07-11T06:35:35.951554Z"},"links":{"citing_paper":"/paper/2607.05511"},"observation_digest":"sha256:b705444f68861f0f952a63373602068394eb2d110df3094d3352675546c77cb1","observation_id":"e69679e1-c332-4a7f-a8c3-61320c32c94f","resolution":{"observed_at":"2026-07-11T06:35:35.951554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T06:35:35.951554Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05511","last_updated":"2026-07-06T18:00:06Z","snapshot_observed_at":"2026-08-12T23:50:27.205160Z","submitted_at":"2026-07-06T18:00:06Z","title":"Light-Omni: Reflex over Reasoning in Agentic Video Understanding with Long-Term Memory","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-07-11T06:35:35.951554Z"},"links":{"citing_paper":"/paper/2607.05511"},"observation_digest":"sha256:64d73c67877ad9f3119a2bd79da9fb723b1b349e26ee29f91243f67c022b132f","observation_id":"803bb632-4a4d-40dc-8550-45877ab08dcb","resolution":{"observed_at":"2026-07-11T06:35:35.951554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T06:35:35.951554Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05511","last_updated":"2026-07-06T18:00:06Z","snapshot_observed_at":"2026-08-12T23:50:27.205160Z","submitted_at":"2026-07-06T18:00:06Z","title":"Light-Omni: Reflex over Reasoning in Agentic Video Understanding with Long-Term Memory","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-07-11T06:35:35.951554Z"},"links":{"citing_paper":"/paper/2607.05511"},"observation_digest":"sha256:3990aaff946602d1e24bb32767c4b000011d59561a45d99902f0211109cd4ff3","observation_id":"aaf3cb29-173f-49ba-891e-4d35c5596d1d","resolution":{"observed_at":"2026-07-11T06:35:35.951554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T06:35:35.951554Z","title":"Current Profiles","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05511","last_updated":"2026-07-06T18:00:06Z","snapshot_observed_at":"2026-08-12T23:50:27.205160Z","submitted_at":"2026-07-06T18:00:06Z","title":"Light-Omni: Reflex over Reasoning in Agentic Video Understanding with Long-Term Memory","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-07-11T06:35:35.951554Z"},"links":{"citing_paper":"/paper/2607.05511"},"observation_digest":"sha256:8cdc3c83b88a5d702de24bbcd361c291e6b0a5835046d2c59a4e4a7ec644b5b5","observation_id":"7f21c658-59cd-4333-b5f7-44753c4cc7f3","resolution":{"observed_at":"2026-07-11T06:35:35.951554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T06:35:35.951554Z","title":"If no update, omit the key","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05511","last_updated":"2026-07-06T18:00:06Z","snapshot_observed_at":"2026-08-12T23:50:27.205160Z","submitted_at":"2026-07-06T18:00:06Z","title":"Light-Omni: Reflex over Reasoning in Agentic Video Understanding with Long-Term Memory","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-07-11T06:35:35.951554Z"},"links":{"citing_paper":"/paper/2607.05511"},"observation_digest":"sha256:d67f1f7427a799741209aa666e5024b2baa7a53645d1be77808245c643b06ca3","observation_id":"c57172bd-493e-4fe9-b5e1-ac635e56b5c1","resolution":{"observed_at":"2026-07-11T06:35:35.951554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T06:35:35.951554Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05511","last_updated":"2026-07-06T18:00:06Z","snapshot_observed_at":"2026-08-12T23:50:27.205160Z","submitted_at":"2026-07-06T18:00:06Z","title":"Light-Omni: Reflex over Reasoning in Agentic Video Understanding with Long-Term Memory","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-07-11T06:35:35.951554Z"},"links":{"citing_paper":"/paper/2607.05511"},"observation_digest":"sha256:dc81dcd5ca4b0de5a4efb8432a9e63e6cb70d4327006ab190d32379b87b6a4ea","observation_id":"baa0063c-6d84-4c1b-b624-006ef9622a1c","resolution":{"observed_at":"2026-07-11T06:35:35.951554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T06:35:35.951554Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05511","last_updated":"2026-07-06T18:00:06Z","snapshot_observed_at":"2026-08-12T23:50:27.205160Z","submitted_at":"2026-07-06T18:00:06Z","title":"Light-Omni: Reflex over Reasoning in Agentic Video Understanding with Long-Term Memory","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-07-11T06:35:35.951554Z"},"links":{"citing_paper":"/paper/2607.05511"},"observation_digest":"sha256:85eed136ccce37e7cbb0b9e1f12f65a8c5b4e439f6eaf7ed761e6b84229174a0","observation_id":"7ed58d79-fd77-4628-9f66-7fe42b10687b","resolution":{"observed_at":"2026-07-11T06:35:35.951554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T06:35:35.951554Z","title":"Energetic","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05511","last_updated":"2026-07-06T18:00:06Z","snapshot_observed_at":"2026-08-12T23:50:27.205160Z","submitted_at":"2026-07-06T18:00:06Z","title":"Light-Omni: Reflex over Reasoning in Agentic Video Understanding with Long-Term Memory","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-07-11T06:35:35.951554Z"},"links":{"citing_paper":"/paper/2607.05511"},"observation_digest":"sha256:d1d73736a04e7b89a01d6b4b6144d2f2e00588a10f414b3c1accc8a33e94e732","observation_id":"166bbd39-9908-40d6-ac28-4572b3ddac2b","resolution":{"observed_at":"2026-07-11T06:35:35.951554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T06:35:35.951554Z","title":"<face_idx>","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05511","last_updated":"2026-07-06T18:00:06Z","snapshot_observed_at":"2026-08-12T23:50:27.205160Z","submitted_at":"2026-07-06T18:00:06Z","title":"Light-Omni: Reflex over Reasoning in Agentic Video Understanding with Long-Term Memory","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-07-11T06:35:35.951554Z"},"links":{"citing_paper":"/paper/2607.05511"},"observation_digest":"sha256:dee8d6ccd6666164bb2213fbe9caa06d6713f6020af419c3154e0acd5afec5b7","observation_id":"a45035ab-04ee-47a4-a8fc-f56e1a771f4c","resolution":{"observed_at":"2026-07-11T06:35:35.951554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T06:35:35.951554Z","title":"* Audio: Extract core dialogue and significant sounds","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05511","last_updated":"2026-07-06T18:00:06Z","snapshot_observed_at":"2026-08-12T23:50:27.205160Z","submitted_at":"2026-07-06T18:00:06Z","title":"Light-Omni: Reflex over Reasoning in Agentic Video Understanding with Long-Term Memory","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-07-11T06:35:35.951554Z"},"links":{"citing_paper":"/paper/2607.05511"},"observation_digest":"sha256:b8f54b6037da6280fbc3c64c15674c813ca300e9621a72c85bc91f434870b048","observation_id":"8a4c1bf5-22bc-44c3-8c77-31b09f5598c3","resolution":{"observed_at":"2026-07-11T06:35:35.951554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T06:35:35.951554Z","title":"visual\":","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05511","last_updated":"2026-07-06T18:00:06Z","snapshot_observed_at":"2026-08-12T23:50:27.205160Z","submitted_at":"2026-07-06T18:00:06Z","title":"Light-Omni: Reflex over Reasoning in Agentic Video Understanding with Long-Term Memory","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-07-11T06:35:35.951554Z"},"links":{"citing_paper":"/paper/2607.05511"},"observation_digest":"sha256:63ec3796888ab76d17a36b7b57a152f440840e834602b9434214d70a79c2cdbf","observation_id":"4734ce93-26b7-4cfa-a93b-e11538d87241","resolution":{"observed_at":"2026-07-11T06:35:35.951554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.05511","last_updated":"2026-07-06T18:00:06Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-12T23:50:27.205160Z","submitted_at":"2026-07-06T18:00:06Z","title":"Light-Omni: Reflex over Reasoning in Agentic Video Understanding with Long-Term Memory"},"reference_resolution":{"displayed":84,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":83,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":84},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 84 of 84 outbound references and 0 inbound Pith citation observations for arXiv:2607.05511."}