{"as_of":"2026-08-10T00:34:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:bc21b8b2a1949417e867af51ca1508a1f94989784aa190f4ed2aa8ddec600add","coverage":[{"denominator":53,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":53,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T09:17:00.737308Z","state":"measured"},{"denominator":53,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":53,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.24794/citation-record","integrity":"/paper/2607.24794/integrity","json":"/paper/2607.24794/citation-record.json","paper":"/paper/2607.24794"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-02T09:17:00.511770Z","title":"arXiv preprint arXiv:2303.08774 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24794","last_updated":"2026-06-30T10:55:56Z","snapshot_observed_at":"2026-08-09T18:48:05.949006Z","submitted_at":"2026-06-30T10:55:56Z","title":"Reasoning with Memory: A Temporal Granularity-Adaptive Framework for Training-Free Long Video Understanding","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T09:17:00.511770Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2607.24794"},"observation_digest":"sha256:7dd62b5543f97fb292463fc5554e79b9fe18a15230c966be27368bea543a026d","observation_id":"dd941821-f874-47fa-8758-d848d3508629","resolution":{"observed_at":"2026-08-02T09:17:00.511770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-02T09:17:00.517189Z","title":"arXiv preprint arXiv:2309.16609 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24794","last_updated":"2026-06-30T10:55:56Z","snapshot_observed_at":"2026-08-09T18:48:05.949006Z","submitted_at":"2026-06-30T10:55:56Z","title":"Reasoning with Memory: A Temporal Granularity-Adaptive Framework for Training-Free Long Video Understanding","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T09:17:00.517189Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2607.24794"},"observation_digest":"sha256:03e7da51fd105bca325906c6358f4fac5b32831f87c1611f6279d895532a0c45","observation_id":"3702b85a-3ff4-45cf-ad4e-31467d370a68","resolution":{"observed_at":"2026-08-02T09:17:00.517189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-02T09:17:00.521832Z","title":"arXiv preprint arXiv:2511.21631 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24794","last_updated":"2026-06-30T10:55:56Z","snapshot_observed_at":"2026-08-09T18:48:05.949006Z","submitted_at":"2026-06-30T10:55:56Z","title":"Reasoning with Memory: A Temporal Granularity-Adaptive Framework for Training-Free Long Video Understanding","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T09:17:00.521832Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2607.24794"},"observation_digest":"sha256:07e097a2a82b05f92719446a03558284bed53dd7bb4a1e373201782abe8aafc8","observation_id":"0f5e1090-2901-4d84-9afe-2204d8ac621b","resolution":{"observed_at":"2026-08-02T09:17:00.521832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T09:17:00.526512Z","title":"5-vl technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24794","last_updated":"2026-06-30T10:55:56Z","snapshot_observed_at":"2026-08-09T18:48:05.949006Z","submitted_at":"2026-06-30T10:55:56Z","title":"Reasoning with Memory: A Temporal Granularity-Adaptive Framework for Training-Free Long Video Understanding","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T09:17:00.526512Z"},"links":{"citing_paper":"/paper/2607.24794"},"observation_digest":"sha256:648eb6c7c3b459799e8911dc345c55e5057e711e25b7c5a271b69b06e622730c","observation_id":"25b417d5-9d0f-41c0-86f0-6f0a8c420374","resolution":{"observed_at":"2026-08-02T09:17:00.526512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.10188","snapshot_observed_at":"2026-08-02T09:17:00.531111Z","title":"arXiv preprint arXiv:2408.10188 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24794","last_updated":"2026-06-30T10:55:56Z","snapshot_observed_at":"2026-08-09T18:48:05.949006Z","submitted_at":"2026-06-30T10:55:56Z","title":"Reasoning with Memory: A Temporal Granularity-Adaptive Framework for Training-Free Long Video Understanding","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T09:17:00.531111Z"},"links":{"cited_paper":"/paper/2408.10188","citing_paper":"/paper/2607.24794"},"observation_digest":"sha256:4fc7c51c18d33f9dd2dde87361880d6a358606dd235201c8c2d803597fbdc0cf","observation_id":"5a34c98e-320c-4300-afb0-5367261abcf7","resolution":{"observed_at":"2026-08-02T09:17:00.531111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07476","snapshot_observed_at":"2026-08-02T09:17:00.535888Z","title":"arXiv preprint arXiv:2406.07476 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24794","last_updated":"2026-06-30T10:55:56Z","snapshot_observed_at":"2026-08-09T18:48:05.949006Z","submitted_at":"2026-06-30T10:55:56Z","title":"Reasoning with Memory: A Temporal Granularity-Adaptive Framework for Training-Free Long Video Understanding","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T09:17:00.535888Z"},"links":{"cited_paper":"/paper/2406.07476","citing_paper":"/paper/2607.24794"},"observation_digest":"sha256:3d73ddece5bc87ee4a49c5842e2219ae1ffbda592b79ed24811aaaf642f44851","observation_id":"e1b0a4c3-f277-44ef-ba68-be387ed96902","resolution":{"observed_at":"2026-08-02T09:17:00.535888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.14023","last_updated":"2024-08-26T05:27:14Z","snapshot_observed_at":"2026-08-07T05:22:51.503928Z","submitted_at":"2024-08-26T05:27:14Z","title":"Video-CCAM: Enhancing Video-Language Understanding with Causal Cross-Attention Masks for Short and Long Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.14023","snapshot_observed_at":"2026-08-02T09:17:00.541193Z","title":"arXiv preprint arXiv:2408.14023 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24794","last_updated":"2026-06-30T10:55:56Z","snapshot_observed_at":"2026-08-09T18:48:05.949006Z","submitted_at":"2026-06-30T10:55:56Z","title":"Reasoning with Memory: A Temporal Granularity-Adaptive Framework for Training-Free Long Video Understanding","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T09:17:00.541193Z"},"links":{"cited_paper":"/paper/2408.14023","citing_paper":"/paper/2607.24794"},"observation_digest":"sha256:8050c6c4bcf44fcb6b6c9594cb763a2fd11ea0db93912808a87e87a76b2dcda0","observation_id":"dc306c73-3c39-4073-9433-30caa848ad63","resolution":{"observed_at":"2026-08-02T09:17:00.541193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21776","last_updated":"2025-10-22T16:42:24Z","snapshot_observed_at":"2026-08-05T07:15:29.998948Z","submitted_at":"2025-03-27T17:59:51Z","title":"Video-R1: Reinforcing Video Reasoning in MLLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21776","snapshot_observed_at":"2026-08-02T09:17:00.545933Z","title":"arXiv preprint arXiv:2503.21776 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24794","last_updated":"2026-06-30T10:55:56Z","snapshot_observed_at":"2026-08-09T18:48:05.949006Z","submitted_at":"2026-06-30T10:55:56Z","title":"Reasoning with Memory: A Temporal Granularity-Adaptive Framework for Training-Free Long Video Understanding","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T09:17:00.545933Z"},"links":{"cited_paper":"/paper/2503.21776","citing_paper":"/paper/2607.24794"},"observation_digest":"sha256:fb59f1062520ece0c65f1811d4bed85c4209852ca88110834867719aa6987d29","observation_id":"9a02c0d5-09b6-480c-a3a6-e90709dc5a4b","resolution":{"observed_at":"2026-08-02T09:17:00.545933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T09:17:00.550665Z","title":"In: Proceedings of the IEEE/CVF conference on computer vision and pattern recognition","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24794","last_updated":"2026-06-30T10:55:56Z","snapshot_observed_at":"2026-08-09T18:48:05.949006Z","submitted_at":"2026-06-30T10:55:56Z","title":"Reasoning with Memory: A Temporal Granularity-Adaptive Framework for Training-Free Long Video Understanding","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T09:17:00.550665Z"},"links":{"citing_paper":"/paper/2607.24794"},"observation_digest":"sha256:309fdc78aebe1b0e751224714e590667d04cceed5661dd5524915fde869acbc0","observation_id":"b5f61625-4413-409f-a8c3-4683fcebf3ab","resolution":{"observed_at":"2026-08-02T09:17:00.550665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00318","last_updated":"2026-04-04T04:38:43Z","snapshot_observed_at":"2026-07-06T21:34:05.672636Z","submitted_at":"2025-05-31T00:08:21Z","title":"Chain-of-Frames: Advancing Video Understanding in Multimodal LLMs via Frame-Aware Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.00318","snapshot_observed_at":"2026-08-02T09:17:00.555120Z","title":"arXiv preprint arXiv:2506.00318 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24794","last_updated":"2026-06-30T10:55:56Z","snapshot_observed_at":"2026-08-09T18:48:05.949006Z","submitted_at":"2026-06-30T10:55:56Z","title":"Reasoning with Memory: A Temporal Granularity-Adaptive Framework for Training-Free Long Video Understanding","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T09:17:00.555120Z"},"links":{"cited_paper":"/paper/2506.00318","citing_paper":"/paper/2607.24794"},"observation_digest":"sha256:0913d0de26551b8eaae2b691de808c9d12bdb04de126ca0a22b6c535d6b443b3","observation_id":"c22ef1de-d33b-49c5-906b-df1904f42806","resolution":{"observed_at":"2026-08-02T09:17:00.555120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13139","last_updated":"2025-05-17T13:22:07Z","snapshot_observed_at":"2026-08-08T12:55:17.970927Z","submitted_at":"2025-03-17T13:07:34Z","title":"Logic-in-Frames: Dynamic Keyframe Search via Visual Semantic-Logical Verification for Long Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.13139","snapshot_observed_at":"2026-08-02T09:17:00.559451Z","title":"arXiv preprint arXiv:2503.13139 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24794","last_updated":"2026-06-30T10:55:56Z","snapshot_observed_at":"2026-08-09T18:48:05.949006Z","submitted_at":"2026-06-30T10:55:56Z","title":"Reasoning with Memory: A Temporal Granularity-Adaptive Framework for Training-Free Long Video Understanding","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T09:17:00.559451Z"},"links":{"cited_paper":"/paper/2503.13139","citing_paper":"/paper/2607.24794"},"observation_digest":"sha256:b719ff482a1921d9331e6f21780e79779599272a6537441b0575cfe60bbb48da","observation_id":"a796e40a-ee10-4eb1-af32-b4a4795cdba3","resolution":{"observed_at":"2026-08-02T09:17:00.559451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T09:17:00.563761Z","title":"In: Proceedings of the Computer Vision and Pattern Recognition Conference","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24794","last_updated":"2026-06-30T10:55:56Z","snapshot_observed_at":"2026-08-09T18:48:05.949006Z","submitted_at":"2026-06-30T10:55:56Z","title":"Reasoning with Memory: A Temporal Granularity-Adaptive Framework for Training-Free Long Video Understanding","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T09:17:00.563761Z"},"links":{"citing_paper":"/paper/2607.24794"},"observation_digest":"sha256:e50121719fd9d42e0bba72274cf161aeb15c31fb71e3263a72767c6ff56ff6c4","observation_id":"df6da93b-70ec-4f72-858b-59ce13b20e71","resolution":{"observed_at":"2026-08-02T09:17:00.563761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T09:17:00.568152Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24794","last_updated":"2026-06-30T10:55:56Z","snapshot_observed_at":"2026-08-09T18:48:05.949006Z","submitted_at":"2026-06-30T10:55:56Z","title":"Reasoning with Memory: A Temporal Granularity-Adaptive Framework for Training-Free Long Video Understanding","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T09:17:00.568152Z"},"links":{"citing_paper":"/paper/2607.24794"},"observation_digest":"sha256:304111f70cbacb134b07e4866cf9a1d0304e8d5954354c7fb1dba0b96b00c2dd","observation_id":"38a3a8bf-2192-4e50-b778-c683a142f001","resolution":{"observed_at":"2026-08-02T09:17:00.568152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-02T09:17:00.572148Z","title":"arXiv preprint arXiv:2408.03326 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24794","last_updated":"2026-06-30T10:55:56Z","snapshot_observed_at":"2026-08-09T18:48:05.949006Z","submitted_at":"2026-06-30T10:55:56Z","title":"Reasoning with Memory: A Temporal Granularity-Adaptive Framework for Training-Free Long Video Understanding","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T09:17:00.572148Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2607.24794"},"observation_digest":"sha256:11fb0a7aa376ae92caab0071a140ad1457c82e435911569be3da5c1da8d78e81","observation_id":"ae9ef788-38f6-44b3-9c96-f45ba69783af","resolution":{"observed_at":"2026-08-02T09:17:00.572148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T09:17:00.576690Z","title":"arXiv preprint arXiv:2510.03584 (2025) Reasoning with Memory 17","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24794","last_updated":"2026-06-30T10:55:56Z","snapshot_observed_at":"2026-08-09T18:48:05.949006Z","submitted_at":"2026-06-30T10:55:56Z","title":"Reasoning with Memory: A Temporal Granularity-Adaptive Framework for Training-Free Long Video Understanding","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T09:17:00.576690Z"},"links":{"citing_paper":"/paper/2607.24794"},"observation_digest":"sha256:16c5fc7a77e6805cc10411144290766840ae74ede0acd02ac89498174f636780","observation_id":"b54f417b-8d24-4a2d-997d-4eb6621c4b3a","resolution":{"observed_at":"2026-08-02T09:17:00.576690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T09:17:00.580657Z","title":"Science China Information Sciences 68(10), 200102 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24794","last_updated":"2026-06-30T10:55:56Z","snapshot_observed_at":"2026-08-09T18:48:05.949006Z","submitted_at":"2026-06-30T10:55:56Z","title":"Reasoning with Memory: A Temporal Granularity-Adaptive Framework for Training-Free Long Video Understanding","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T09:17:00.580657Z"},"links":{"citing_paper":"/paper/2607.24794"},"observation_digest":"sha256:98cb0fd72c1bb67dfbc2074a0809df7a791b8c12c41f62cfd27f325df4cb455c","observation_id":"1f60e15d-e7c8-4f34-9ddd-f1df110be1dd","resolution":{"observed_at":"2026-08-02T09:17:00.580657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T09:17:00.584587Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24794","last_updated":"2026-06-30T10:55:56Z","snapshot_observed_at":"2026-08-09T18:48:05.949006Z","submitted_at":"2026-06-30T10:55:56Z","title":"Reasoning with Memory: A Temporal Granularity-Adaptive Framework for Training-Free Long Video Understanding","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T09:17:00.584587Z"},"links":{"citing_paper":"/paper/2607.24794"},"observation_digest":"sha256:0c2c5b3d31d38450bbeb8617adfe2b9b01ba397733f81fecd86ebcb3248ee170","observation_id":"21122611-aee7-4c28-80ad-03c6708540dd","resolution":{"observed_at":"2026-08-02T09:17:00.584587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.06958","snapshot_observed_at":"2026-08-02T09:17:00.588877Z","title":"arXiv preprint arXiv:2504.06958 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24794","last_updated":"2026-06-30T10:55:56Z","snapshot_observed_at":"2026-08-09T18:48:05.949006Z","submitted_at":"2026-06-30T10:55:56Z","title":"Reasoning with Memory: A Temporal Granularity-Adaptive Framework for Training-Free Long Video Understanding","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T09:17:00.588877Z"},"links":{"cited_paper":"/paper/2504.06958","citing_paper":"/paper/2607.24794"},"observation_digest":"sha256:ab6ac54405b763e17aa41ffcbb38e376e942cd5d4fdab7fab336132a9f1525fc","observation_id":"891a9b18-05ab-45ab-af4f-eed5eb545fd2","resolution":{"observed_at":"2026-08-02T09:17:00.588877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T09:17:00.593113Z","title":"In: European Conference on Computer Vision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24794","last_updated":"2026-06-30T10:55:56Z","snapshot_observed_at":"2026-08-09T18:48:05.949006Z","submitted_at":"2026-06-30T10:55:56Z","title":"Reasoning with Memory: A Temporal Granularity-Adaptive Framework for Training-Free Long Video Understanding","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T09:17:00.593113Z"},"links":{"citing_paper":"/paper/2607.24794"},"observation_digest":"sha256:d4d766ad87de8fad25abccf37ec5a05af59fff86b6b84b65e09e3e9877784e78","observation_id":"f9b2cd4c-6aeb-48db-aeea-95f672688674","resolution":{"observed_at":"2026-08-02T09:17:00.593113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.03104","last_updated":"2024-08-10T14:57:37Z","snapshot_observed_at":"2026-07-06T18:40:57.362549Z","submitted_at":"2024-07-03T13:41:44Z","title":"KeyVideoLLM: Towards Large-scale Video Keyframe Selection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.03104","snapshot_observed_at":"2026-08-02T09:17:00.597095Z","title":"arXiv preprint arXiv:2407.03104 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24794","last_updated":"2026-06-30T10:55:56Z","snapshot_observed_at":"2026-08-09T18:48:05.949006Z","submitted_at":"2026-06-30T10:55:56Z","title":"Reasoning with Memory: A Temporal Granularity-Adaptive Framework for Training-Free Long Video Understanding","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T09:17:00.597095Z"},"links":{"cited_paper":"/paper/2407.03104","citing_paper":"/paper/2607.24794"},"observation_digest":"sha256:04b124aa4f52ee77ee52333c950cecd48532295e02dbad4a0eae79644f0068f1","observation_id":"278fde52-fa8a-4fbb-9267-5625a466fbdc","resolution":{"observed_at":"2026-08-02T09:17:00.597095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T09:17:00.601522Z","title":"In: Proceedings of the 2024 conference on empirical methods in natural language processing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24794","last_updated":"2026-06-30T10:55:56Z","snapshot_observed_at":"2026-08-09T18:48:05.949006Z","submitted_at":"2026-06-30T10:55:56Z","title":"Reasoning with Memory: A Temporal Granularity-Adaptive Framework for Training-Free Long Video Understanding","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T09:17:00.601522Z"},"links":{"citing_paper":"/paper/2607.24794"},"observation_digest":"sha256:1390892f24bac17d821030b566d7538238a482ec4f91ac4ed951950a3e1ae7f4","observation_id":"f87ee396-003f-4ce2-967d-114cdb3439f3","resolution":{"observed_at":"2026-08-02T09:17:00.601522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T09:17:00.605388Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24794","last_updated":"2026-06-30T10:55:56Z","snapshot_observed_at":"2026-08-09T18:48:05.949006Z","submitted_at":"2026-06-30T10:55:56Z","title":"Reasoning with Memory: A Temporal Granularity-Adaptive Framework for Training-Free Long Video Understanding","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T09:17:00.605388Z"},"links":{"citing_paper":"/paper/2607.24794"},"observation_digest":"sha256:cad203dd49aacebdaf6a5a1d954cd3cf16f7014cdc1cc54a922d5441c4cf0aff","observation_id":"e23e734b-6cde-40a8-b9a1-7974ab58d4f2","resolution":{"observed_at":"2026-08-02T09:17:00.605388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T09:17:00.610079Z","title":"Advances in neural information processing systems36, 34892–34916 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24794","last_updated":"2026-06-30T10:55:56Z","snapshot_observed_at":"2026-08-09T18:48:05.949006Z","submitted_at":"2026-06-30T10:55:56Z","title":"Reasoning with Memory: A Temporal Granularity-Adaptive Framework for Training-Free Long Video Understanding","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T09:17:00.610079Z"},"links":{"citing_paper":"/paper/2607.24794"},"observation_digest":"sha256:8bbefe77fa04418f01f677aa7f0e86c0dfb34296d214bab55c12079200a01d39","observation_id":"8012af7b-d450-4efd-a6de-9b0071290a13","resolution":{"observed_at":"2026-08-02T09:17:00.610079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T09:17:00.614365Z","title":"In: Proceedings of the Com- puter Vision and Pattern Recognition Conference","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24794","last_updated":"2026-06-30T10:55:56Z","snapshot_observed_at":"2026-08-09T18:48:05.949006Z","submitted_at":"2026-06-30T10:55:56Z","title":"Reasoning with Memory: A Temporal Granularity-Adaptive Framework for Training-Free Long Video Understanding","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T09:17:00.614365Z"},"links":{"citing_paper":"/paper/2607.24794"},"observation_digest":"sha256:e697838bcf7a45dbec079f202f7015e551f1fe1d406069fe2efe6f6cd8138290","observation_id":"5a0ec5ec-d4d0-44df-871e-0fdd7b9e24ff","resolution":{"observed_at":"2026-08-02T09:17:00.614365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T09:17:00.618532Z","title":"In: Proceedings of the 62nd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24794","last_updated":"2026-06-30T10:55:56Z","snapshot_observed_at":"2026-08-09T18:48:05.949006Z","submitted_at":"2026-06-30T10:55:56Z","title":"Reasoning with Memory: A Temporal Granularity-Adaptive Framework for Training-Free Long Video Understanding","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T09:17:00.618532Z"},"links":{"citing_paper":"/paper/2607.24794"},"observation_digest":"sha256:f3a4500be01c22fa7f64646117c46c26699e8fecf47ebd1a914fac5529805558","observation_id":"fb45bd07-9f53-4cf7-9500-88f2466d8bf3","resolution":{"observed_at":"2026-08-02T09:17:00.618532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T09:17:00.622552Z","title":"In: International conference on machine learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.24794","last_updated":"2026-06-30T10:55:56Z","snapshot_observed_at":"2026-08-09T18:48:05.949006Z","submitted_at":"2026-06-30T10:55:56Z","title":"Reasoning with Memory: A Temporal Granularity-Adaptive Framework for Training-Free Long Video Understanding","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-02T09:17:00.622552Z"},"links":{"citing_paper":"/paper/2607.24794"},"observation_digest":"sha256:ea8feafe42ef1f1ba5917ecb8ddcc46cb9bea6e8718c47b0ab4c236cbb27c63a","observation_id":"936f58dc-ef05-49c1-86ae-200f05c46ed4","resolution":{"observed_at":"2026-08-02T09:17:00.622552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T09:17:00.626887Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24794","last_updated":"2026-06-30T10:55:56Z","snapshot_observed_at":"2026-08-09T18:48:05.949006Z","submitted_at":"2026-06-30T10:55:56Z","title":"Reasoning with Memory: A Temporal Granularity-Adaptive Framework for Training-Free Long Video Understanding","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-02T09:17:00.626887Z"},"links":{"citing_paper":"/paper/2607.24794"},"observation_digest":"sha256:81d975e7674b328cd1030ad8d6351945a7edbf52e728a01d08974edcd227909d","observation_id":"a80618cb-d6d4-4db7-86bf-fac6c477f7d6","resolution":{"observed_at":"2026-08-02T09:17:00.626887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17434","last_updated":"2024-10-22T21:21:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-22T21:21:37Z","title":"LongVU: Spatiotemporal Adaptive Compression for Long Video-Language Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.17434","snapshot_observed_at":"2026-08-02T09:17:00.631346Z","title":"arXiv preprint arXiv:2410.17434 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24794","last_updated":"2026-06-30T10:55:56Z","snapshot_observed_at":"2026-08-09T18:48:05.949006Z","submitted_at":"2026-06-30T10:55:56Z","title":"Reasoning with Memory: A Temporal Granularity-Adaptive Framework for Training-Free Long Video Understanding","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T09:17:00.631346Z"},"links":{"cited_paper":"/paper/2410.17434","citing_paper":"/paper/2607.24794"},"observation_digest":"sha256:6248bb52c9a3dc76cfcaac0ed67ff211d8dd008bacdc08b06d70b1ed385db432","observation_id":"ebbdd6a3-4465-4499-b6f6-768c990ad258","resolution":{"observed_at":"2026-08-02T09:17:00.631346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T09:17:00.636045Z","title":"In: Proceedings of the Computer Vision and Pattern Recognition Conference","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24794","last_updated":"2026-06-30T10:55:56Z","snapshot_observed_at":"2026-08-09T18:48:05.949006Z","submitted_at":"2026-06-30T10:55:56Z","title":"Reasoning with Memory: A Temporal Granularity-Adaptive Framework for Training-Free Long Video Understanding","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-02T09:17:00.636045Z"},"links":{"citing_paper":"/paper/2607.24794"},"observation_digest":"sha256:efed37d68812d6138473345274032dddf01f07a2ecc0272708bad9c45aa24902","observation_id":"7c30e099-1d52-4083-b886-0ff6dabcea15","resolution":{"observed_at":"2026-08-02T09:17:00.636045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T09:17:00.640021Z","title":"arXiv preprint arXiv:2602.03615 (2026) 18 L","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.24794","last_updated":"2026-06-30T10:55:56Z","snapshot_observed_at":"2026-08-09T18:48:05.949006Z","submitted_at":"2026-06-30T10:55:56Z","title":"Reasoning with Memory: A Temporal Granularity-Adaptive Framework for Training-Free Long Video Understanding","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-02T09:17:00.640021Z"},"links":{"citing_paper":"/paper/2607.24794"},"observation_digest":"sha256:f8bfccb7630fd77403d976e26fd37628c94408daad4020f263754ce7c9591b1d","observation_id":"d290d559-03e9-4b80-ad9b-0fce13ecb049","resolution":{"observed_at":"2026-08-02T09:17:00.640021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T09:17:00.643859Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24794","last_updated":"2026-06-30T10:55:56Z","snapshot_observed_at":"2026-08-09T18:48:05.949006Z","submitted_at":"2026-06-30T10:55:56Z","title":"Reasoning with Memory: A Temporal Granularity-Adaptive Framework for Training-Free Long Video Understanding","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-02T09:17:00.643859Z"},"links":{"citing_paper":"/paper/2607.24794"},"observation_digest":"sha256:c5021aea13ac5ebd94175250976af3e0876b678fad3fc689aa3304b91a56af22","observation_id":"924c7e14-e153-47a4-83e2-10a092f54d30","resolution":{"observed_at":"2026-08-02T09:17:00.643859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T09:17:00.648083Z","title":"In: Proceedings of the IEEE/CVF International Conference on Computer Vision","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24794","last_updated":"2026-06-30T10:55:56Z","snapshot_observed_at":"2026-08-09T18:48:05.949006Z","submitted_at":"2026-06-30T10:55:56Z","title":"Reasoning with Memory: A Temporal Granularity-Adaptive Framework for Training-Free Long Video Understanding","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-02T09:17:00.648083Z"},"links":{"citing_paper":"/paper/2607.24794"},"observation_digest":"sha256:1a3a4c4c30268fbdf953ba465dbdef67210d8da8eadb0e8247121c464afde1b8","observation_id":"c6714c93-efa6-4f52-bc99-28f71d33161b","resolution":{"observed_at":"2026-08-02T09:17:00.648083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T09:17:00.652476Z","title":"In: Proceedings of the Computer Vision and Pattern Recognition Conference","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24794","last_updated":"2026-06-30T10:55:56Z","snapshot_observed_at":"2026-08-09T18:48:05.949006Z","submitted_at":"2026-06-30T10:55:56Z","title":"Reasoning with Memory: A Temporal Granularity-Adaptive Framework for Training-Free Long Video Understanding","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-02T09:17:00.652476Z"},"links":{"citing_paper":"/paper/2607.24794"},"observation_digest":"sha256:975014fe6470a9779e4cee4a7e1751190496e44d5e255e0e45254e64cc0d1200","observation_id":"64faf436-0acf-4c55-a8cb-0c9e780ad3db","resolution":{"observed_at":"2026-08-02T09:17:00.652476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-02T09:17:00.656581Z","title":"arXiv preprint arXiv:2409.12191 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24794","last_updated":"2026-06-30T10:55:56Z","snapshot_observed_at":"2026-08-09T18:48:05.949006Z","submitted_at":"2026-06-30T10:55:56Z","title":"Reasoning with Memory: A Temporal Granularity-Adaptive Framework for Training-Free Long Video Understanding","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-02T09:17:00.656581Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2607.24794"},"observation_digest":"sha256:43c0045ed8d777bc45231411855ab023b46a393c2fd2567c6c0ea7cfdaa909df","observation_id":"bbcd10d5-c6b3-4b3e-a113-b2241926d37f","resolution":{"observed_at":"2026-08-02T09:17:00.656581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T09:17:00.660669Z","title":"In: Proceedings of the IEEE/CVF International Conference on Computer Vision","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24794","last_updated":"2026-06-30T10:55:56Z","snapshot_observed_at":"2026-08-09T18:48:05.949006Z","submitted_at":"2026-06-30T10:55:56Z","title":"Reasoning with Memory: A Temporal Granularity-Adaptive Framework for Training-Free Long Video Understanding","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-02T09:17:00.660669Z"},"links":{"citing_paper":"/paper/2607.24794"},"observation_digest":"sha256:46347afeff5a58b88109bc0ec60946fb906b8fe72aab4e5c8bed184bb594a7d8","observation_id":"0a3649d5-a1b2-4f7b-9cce-1b1318875ba4","resolution":{"observed_at":"2026-08-02T09:17:00.660669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06942","snapshot_observed_at":"2026-08-02T09:17:00.664674Z","title":"arXiv preprint arXiv:2307.06942 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24794","last_updated":"2026-06-30T10:55:56Z","snapshot_observed_at":"2026-08-09T18:48:05.949006Z","submitted_at":"2026-06-30T10:55:56Z","title":"Reasoning with Memory: A Temporal Granularity-Adaptive Framework for Training-Free Long Video Understanding","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-02T09:17:00.664674Z"},"links":{"cited_paper":"/paper/2307.06942","citing_paper":"/paper/2607.24794"},"observation_digest":"sha256:1b1e244d554f5c47eb0f74a060bedfedd842a124ab105064d0fbacce07b1441d","observation_id":"90122d2e-2650-4361-8e45-90c25df1d96c","resolution":{"observed_at":"2026-08-02T09:17:00.664674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T09:17:00.669349Z","title":"In: European conference on computer vision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24794","last_updated":"2026-06-30T10:55:56Z","snapshot_observed_at":"2026-08-09T18:48:05.949006Z","submitted_at":"2026-06-30T10:55:56Z","title":"Reasoning with Memory: A Temporal Granularity-Adaptive Framework for Training-Free Long Video Understanding","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-02T09:17:00.669349Z"},"links":{"citing_paper":"/paper/2607.24794"},"observation_digest":"sha256:63b88d6ada41dd46485499c2b258f5e2e2dfdf990014cf1fe3be51f6aeec40a4","observation_id":"fb65a3fd-5c7a-48cf-a620-210305680f44","resolution":{"observed_at":"2026-08-02T09:17:00.669349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T09:17:00.673498Z","title":"Advances in Neural Information Pro- cessing Systems37, 28828–28857 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24794","last_updated":"2026-06-30T10:55:56Z","snapshot_observed_at":"2026-08-09T18:48:05.949006Z","submitted_at":"2026-06-30T10:55:56Z","title":"Reasoning with Memory: A Temporal Granularity-Adaptive Framework for Training-Free Long Video Understanding","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-02T09:17:00.673498Z"},"links":{"citing_paper":"/paper/2607.24794"},"observation_digest":"sha256:066af1ed2396c924dda69a38b80bda475d009de9d6e68f0f6c6dfbb0917cc34b","observation_id":"0b6e3ec4-8908-4f24-9db3-ea2c591a1004","resolution":{"observed_at":"2026-08-02T09:17:00.673498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T09:17:00.677992Z","title":"In: Findings of the Association for Computational Linguistics: ACL 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24794","last_updated":"2026-06-30T10:55:56Z","snapshot_observed_at":"2026-08-09T18:48:05.949006Z","submitted_at":"2026-06-30T10:55:56Z","title":"Reasoning with Memory: A Temporal Granularity-Adaptive Framework for Training-Free Long Video Understanding","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-02T09:17:00.677992Z"},"links":{"citing_paper":"/paper/2607.24794"},"observation_digest":"sha256:6bb3b944fb8efc5e54b1dd0c3b6c7a26bf5d7e52cbbb41b6402e410b24b8f2c3","observation_id":"4e83fd94-5cfb-4513-98d9-bf647f857d96","resolution":{"observed_at":"2026-08-02T09:17:00.677992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T09:17:00.682138Z","title":"Advances in Neural Information Processing Systems36, 76749–76771 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24794","last_updated":"2026-06-30T10:55:56Z","snapshot_observed_at":"2026-08-09T18:48:05.949006Z","submitted_at":"2026-06-30T10:55:56Z","title":"Reasoning with Memory: A Temporal Granularity-Adaptive Framework for Training-Free Long Video Understanding","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-02T09:17:00.682138Z"},"links":{"citing_paper":"/paper/2607.24794"},"observation_digest":"sha256:4c33675d86fc35957d94a94d763928a9cbb11cdd09101025e24f34895e95417d","observation_id":"3fad15c3-8c26-464f-8808-6a842a0f5a06","resolution":{"observed_at":"2026-08-02T09:17:00.682138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03226","last_updated":"2025-03-28T03:19:52Z","snapshot_observed_at":"2026-07-06T19:27:33.934338Z","submitted_at":"2024-10-04T08:26:06Z","title":"Frame-Voyager: Learning to Query Frames for Video Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03226","snapshot_observed_at":"2026-08-02T09:17:00.686105Z","title":"arXiv preprint arXiv:2410.03226 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24794","last_updated":"2026-06-30T10:55:56Z","snapshot_observed_at":"2026-08-09T18:48:05.949006Z","submitted_at":"2026-06-30T10:55:56Z","title":"Reasoning with Memory: A Temporal Granularity-Adaptive Framework for Training-Free Long Video Understanding","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-02T09:17:00.686105Z"},"links":{"cited_paper":"/paper/2410.03226","citing_paper":"/paper/2607.24794"},"observation_digest":"sha256:7dc9a266c078ff1ce609648a1c2bcd976bf6407208bb8e0f47a4b76e3bc00860","observation_id":"4d60bb00-203a-46b2-aa67-6539123e0776","resolution":{"observed_at":"2026-08-02T09:17:00.686105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13106","last_updated":"2025-06-03T03:33:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T18:59:46Z","title":"VideoLLaMA 3: Frontier Multimodal Foundation Models for Image and Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13106","snapshot_observed_at":"2026-08-02T09:17:00.690611Z","title":"arXiv preprint arXiv:2501.13106 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24794","last_updated":"2026-06-30T10:55:56Z","snapshot_observed_at":"2026-08-09T18:48:05.949006Z","submitted_at":"2026-06-30T10:55:56Z","title":"Reasoning with Memory: A Temporal Granularity-Adaptive Framework for Training-Free Long Video Understanding","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-02T09:17:00.690611Z"},"links":{"cited_paper":"/paper/2501.13106","citing_paper":"/paper/2607.24794"},"observation_digest":"sha256:1227bea21b09d805f0046e42acc972707f34eaacbe5d2b6c6656e51973438bec","observation_id":"8c8c2ba3-bc9a-4eda-93a8-2ce2da7a1379","resolution":{"observed_at":"2026-08-02T09:17:00.690611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T09:17:00.694766Z","title":"In: Proceedings of the 2024 Conference on Empirical Methods in Natural Language Processing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24794","last_updated":"2026-06-30T10:55:56Z","snapshot_observed_at":"2026-08-09T18:48:05.949006Z","submitted_at":"2026-06-30T10:55:56Z","title":"Reasoning with Memory: A Temporal Granularity-Adaptive Framework for Training-Free Long Video Understanding","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-02T09:17:00.694766Z"},"links":{"citing_paper":"/paper/2607.24794"},"observation_digest":"sha256:0d86c533204fe66f449aa78767265e80e52a57b7b19b33097c0c2a7716f39e86","observation_id":"c2b16969-4749-48d9-bf38-8948feb82bca","resolution":{"observed_at":"2026-08-02T09:17:00.694766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T09:17:00.698642Z","title":"IEEE Transactions on Infor- mation Forensics and Security (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24794","last_updated":"2026-06-30T10:55:56Z","snapshot_observed_at":"2026-08-09T18:48:05.949006Z","submitted_at":"2026-06-30T10:55:56Z","title":"Reasoning with Memory: A Temporal Granularity-Adaptive Framework for Training-Free Long Video Understanding","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-02T09:17:00.698642Z"},"links":{"citing_paper":"/paper/2607.24794"},"observation_digest":"sha256:f783b9893ae7cc671fadebb324f6a0c441652b12cf5fe14e838a544ece288625","observation_id":"7a9ea81b-99a8-482f-bd1e-92de0edb5a43","resolution":{"observed_at":"2026-08-02T09:17:00.698642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T09:17:00.702872Z","title":"IEEE Transactions on Circuits and Systems for Video Technology (2026) Reasoning with Memory 19","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.24794","last_updated":"2026-06-30T10:55:56Z","snapshot_observed_at":"2026-08-09T18:48:05.949006Z","submitted_at":"2026-06-30T10:55:56Z","title":"Reasoning with Memory: A Temporal Granularity-Adaptive Framework for Training-Free Long Video Understanding","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-02T09:17:00.702872Z"},"links":{"citing_paper":"/paper/2607.24794"},"observation_digest":"sha256:a33ef2865e6d36962d424322554282d481138a840bbc8bc9171170e5588f6a85","observation_id":"1c0548e8-5ea2-4857-b148-23cdcbebae8a","resolution":{"observed_at":"2026-08-02T09:17:00.702872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-02T09:17:00.707071Z","title":"arXiv preprint arXiv:2406.16852 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24794","last_updated":"2026-06-30T10:55:56Z","snapshot_observed_at":"2026-08-09T18:48:05.949006Z","submitted_at":"2026-06-30T10:55:56Z","title":"Reasoning with Memory: A Temporal Granularity-Adaptive Framework for Training-Free Long Video Understanding","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-02T09:17:00.707071Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2607.24794"},"observation_digest":"sha256:14ef7569503188f93648022b452d1a003b7fe1399beed63c9f692824e50e3db3","observation_id":"0fdc82a5-17ce-4623-ade5-544822d51adb","resolution":{"observed_at":"2026-08-02T09:17:00.707071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T09:17:00.711545Z","title":"In: Proceedings of the IEEE/CVF International Conference on Computer Vision","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24794","last_updated":"2026-06-30T10:55:56Z","snapshot_observed_at":"2026-08-09T18:48:05.949006Z","submitted_at":"2026-06-30T10:55:56Z","title":"Reasoning with Memory: A Temporal Granularity-Adaptive Framework for Training-Free Long Video Understanding","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-02T09:17:00.711545Z"},"links":{"citing_paper":"/paper/2607.24794"},"observation_digest":"sha256:d424bdfd2efc6df9539fc77abd95f45a7dee30f92f9e67a224144930ec21c775","observation_id":"8ef9301f-8e8f-4ebc-8c5f-1649636531a1","resolution":{"observed_at":"2026-08-02T09:17:00.711545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02713","last_updated":"2025-08-01T16:40:14Z","snapshot_observed_at":"2026-08-02T12:24:31.329178Z","submitted_at":"2024-10-03T17:36:49Z","title":"LLaVA-Video: Video Instruction Tuning With Synthetic Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02713","snapshot_observed_at":"2026-08-02T09:17:00.715720Z","title":"arXiv preprint arXiv:2410.02713 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24794","last_updated":"2026-06-30T10:55:56Z","snapshot_observed_at":"2026-08-09T18:48:05.949006Z","submitted_at":"2026-06-30T10:55:56Z","title":"Reasoning with Memory: A Temporal Granularity-Adaptive Framework for Training-Free Long Video Understanding","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-02T09:17:00.715720Z"},"links":{"cited_paper":"/paper/2410.02713","citing_paper":"/paper/2607.24794"},"observation_digest":"sha256:624079c495b280dc221b0564770d0490738680d3e123a3b4d31ef81c6f97be83","observation_id":"aa73e4af-e569-40f7-9688-2695e30b8fe6","resolution":{"observed_at":"2026-08-02T09:17:00.715720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00993","last_updated":"2025-06-01T12:49:39Z","snapshot_observed_at":"2026-08-08T18:44:33.509277Z","submitted_at":"2025-06-01T12:49:39Z","title":"FlexSelect: Flexible Token Selection for Efficient Long Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.00993","snapshot_observed_at":"2026-08-02T09:17:00.719844Z","title":"arXiv preprint arXiv:2506.00993 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24794","last_updated":"2026-06-30T10:55:56Z","snapshot_observed_at":"2026-08-09T18:48:05.949006Z","submitted_at":"2026-06-30T10:55:56Z","title":"Reasoning with Memory: A Temporal Granularity-Adaptive Framework for Training-Free Long Video Understanding","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-02T09:17:00.719844Z"},"links":{"cited_paper":"/paper/2506.00993","citing_paper":"/paper/2607.24794"},"observation_digest":"sha256:6905b416763f9b2714a65862f4e26bcf2cb83816ae55058834b172e58dd987de","observation_id":"fd526ce5-1a3b-4b14-91b0-56a7c9883c5e","resolution":{"observed_at":"2026-08-02T09:17:00.719844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T09:17:00.724424Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24794","last_updated":"2026-06-30T10:55:56Z","snapshot_observed_at":"2026-08-09T18:48:05.949006Z","submitted_at":"2026-06-30T10:55:56Z","title":"Reasoning with Memory: A Temporal Granularity-Adaptive Framework for Training-Free Long Video Understanding","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-02T09:17:00.724424Z"},"links":{"citing_paper":"/paper/2607.24794"},"observation_digest":"sha256:c32e5656d0ee7503b70a47afa1e62b3f5a0626b7993894056c0f7bbc47c5a5c8","observation_id":"280810e7-17d9-4b8f-9821-3eb32dab6f07","resolution":{"observed_at":"2026-08-02T09:17:00.724424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04264","last_updated":"2025-01-01T15:53:58Z","snapshot_observed_at":"2026-08-03T20:38:36.602554Z","submitted_at":"2024-06-06T17:09:32Z","title":"MLVU: Benchmarking Multi-task Long Video Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04264","snapshot_observed_at":"2026-08-02T09:17:00.728552Z","title":"arXiv preprint arXiv:2406.042642(5), 6 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24794","last_updated":"2026-06-30T10:55:56Z","snapshot_observed_at":"2026-08-09T18:48:05.949006Z","submitted_at":"2026-06-30T10:55:56Z","title":"Reasoning with Memory: A Temporal Granularity-Adaptive Framework for Training-Free Long Video Understanding","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-02T09:17:00.728552Z"},"links":{"cited_paper":"/paper/2406.04264","citing_paper":"/paper/2607.24794"},"observation_digest":"sha256:903d136b9e2c0c741a381e96088840831157864b695714e56809e06a4c8a60bb","observation_id":"a07ed3a8-269f-49f8-9bad-65d2a499ca02","resolution":{"observed_at":"2026-08-02T09:17:00.728552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-02T09:17:00.732914Z","title":"arXiv preprint arXiv:2304.10592 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24794","last_updated":"2026-06-30T10:55:56Z","snapshot_observed_at":"2026-08-09T18:48:05.949006Z","submitted_at":"2026-06-30T10:55:56Z","title":"Reasoning with Memory: A Temporal Granularity-Adaptive Framework for Training-Free Long Video Understanding","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-02T09:17:00.732914Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2607.24794"},"observation_digest":"sha256:4c651ea5e39697ed2568587cfe28ced9b85d2d727f02e7e032dda8c44a455012","observation_id":"2f4cd03a-619f-41af-a88e-4c2672ad628d","resolution":{"observed_at":"2026-08-02T09:17:00.732914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T09:17:00.737308Z","title":"arXiv preprint arXiv:2510.27280 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24794","last_updated":"2026-06-30T10:55:56Z","snapshot_observed_at":"2026-08-09T18:48:05.949006Z","submitted_at":"2026-06-30T10:55:56Z","title":"Reasoning with Memory: A Temporal Granularity-Adaptive Framework for Training-Free Long Video Understanding","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-02T09:17:00.737308Z"},"links":{"citing_paper":"/paper/2607.24794"},"observation_digest":"sha256:adfa7b31025fe3c7b0b05eea6c81ad305cffff14d2d701ec61654db77c315d73","observation_id":"42bcc785-5ecd-4532-8f17-42fb56a35ea7","resolution":{"observed_at":"2026-08-02T09:17:00.737308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.24794","last_updated":"2026-06-30T10:55:56Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-09T18:48:05.949006Z","submitted_at":"2026-06-30T10:55:56Z","title":"Reasoning with Memory: A Temporal Granularity-Adaptive Framework for Training-Free Long Video Understanding"},"reference_resolution":{"displayed":53,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":53,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":53},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 53 of 53 outbound references and 0 inbound Pith citation observations for arXiv:2607.24794."}