{"as_of":"2026-08-23T16:21:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f66327d0c04db2f05873a17727ac43213a2b8c76d16f622c3095df98be0f7f96","coverage":[{"denominator":58,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":58,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:35:51.010785Z","state":"measured"},{"denominator":60,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":60,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T19:15:02.124035Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-11T20:06:13.270265Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.07600","last_updated":"2025-06-09T10:00:54Z","snapshot_observed_at":"2026-08-19T22:04:44.573189Z","submitted_at":"2025-06-09T10:00:54Z","title":"SceneRAG: Scene-level Retrieval-Augmented Generation for Video Understanding","version":1},"cited_work":{"arxiv_id":"2506.07600","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.07600","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scenerag: Scene-level retrieval- augmented generation for video understanding","venue":null,"work_id":"05106e58-90f8-4ad2-8d0c-f8e91bad34e9","year":2025},"citing_paper":{"arxiv_id":"2604.05418","last_updated":"2026-04-16T09:51:53Z","snapshot_observed_at":"2026-08-13T01:46:29.436206Z","submitted_at":"2026-04-07T04:26:59Z","title":"VideoStir: Understanding Long Videos via Spatio-Temporally Structured and Intent-Aware RAG","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-10T19:15:02.124035Z"},"links":{"cited_paper":"/paper/2506.07600","citing_paper":"/paper/2604.05418"},"observation_digest":"sha256:caf0e2de2ffaedc10799db1a86967b3eda9e42d712734368019581fc9bed9f1b","observation_id":"421e6316-0ac4-469d-b56b-9ab6d9809818","resolution":{"observed_at":"2026-05-10T23:15:50.244866Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07600","last_updated":"2025-06-09T10:00:54Z","snapshot_observed_at":"2026-08-19T22:04:44.573189Z","submitted_at":"2025-06-09T10:00:54Z","title":"SceneRAG: Scene-level Retrieval-Augmented Generation for Video Understanding","version":1},"cited_work":{"arxiv_id":"2506.07600","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.07600","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scenerag: Scene-level retrieval- augmented generation for video understanding","venue":null,"work_id":"05106e58-90f8-4ad2-8d0c-f8e91bad34e9","year":2025},"citing_paper":{"arxiv_id":"2605.06185","last_updated":"2026-08-19T09:39:53Z","snapshot_observed_at":"2026-08-22T23:09:29.265609Z","submitted_at":"2026-05-07T13:01:28Z","title":"Event-Causal RAG: A Retrieval-Augmented Generation Framework for Long Video Reasoning in Complex Scenarios","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-08T10:15:15.129358Z"},"links":{"cited_paper":"/paper/2506.07600","citing_paper":"/paper/2605.06185"},"observation_digest":"sha256:49d0c4ceb98b043442d38d92ba2c8896b3cae6011a94ad7b9db410b48cdd9d4a","observation_id":"47a983ba-dc27-4128-a3a7-eec95b5f3594","resolution":{"observed_at":"2026-05-11T20:06:13.272901Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.07600/citation-record","integrity":"/paper/2506.07600/integrity","json":"/paper/2506.07600/citation-record.json","paper":"/paper/2506.07600"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.08826","last_updated":"2025-06-02T17:15:08Z","snapshot_observed_at":"2026-08-17T02:21:13.289013Z","submitted_at":"2025-02-12T22:33:41Z","title":"Ask in Any Modality: A Comprehensive Survey on Multimodal Retrieval-Augmented Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.08826","snapshot_observed_at":"2026-08-07T05:35:50.716342Z","title":"Ask in any modality: A comprehensive survey on multimodal retrieval-augmented generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07600","last_updated":"2025-06-09T10:00:54Z","snapshot_observed_at":"2026-08-19T22:04:44.573189Z","submitted_at":"2025-06-09T10:00:54Z","title":"SceneRAG: Scene-level Retrieval-Augmented Generation for Video Understanding","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:50.716342Z"},"links":{"cited_paper":"/paper/2502.08826","citing_paper":"/paper/2506.07600"},"observation_digest":"sha256:c40933ce7081025fb18557e4ecbd324a97e8c1650fb9f9ab1c243871a2537b00","observation_id":"0f78863e-e058-499f-8271-8b3df8218a37","resolution":{"observed_at":"2026-08-07T05:35:50.716342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:35:50.722098Z","title":"Flamingo: a visual language model for few-shot learning.Advances in neural information processing systems, 35: 23716–23736, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.07600","last_updated":"2025-06-09T10:00:54Z","snapshot_observed_at":"2026-08-19T22:04:44.573189Z","submitted_at":"2025-06-09T10:00:54Z","title":"SceneRAG: Scene-level Retrieval-Augmented Generation for Video Understanding","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:50.722098Z"},"links":{"citing_paper":"/paper/2506.07600"},"observation_digest":"sha256:8683c4d585342e2ec78486d8f39b1dcde5d6a2ec55afff7c51332c4d84fda3e0","observation_id":"b63a5283-71c9-45e2-a079-fc9ef20f04ec","resolution":{"observed_at":"2026-08-07T05:35:50.722098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:35:50.726908Z","title":"Vivit: A video vision transformer","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.07600","last_updated":"2025-06-09T10:00:54Z","snapshot_observed_at":"2026-08-19T22:04:44.573189Z","submitted_at":"2025-06-09T10:00:54Z","title":"SceneRAG: Scene-level Retrieval-Augmented Generation for Video Understanding","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:50.726908Z"},"links":{"citing_paper":"/paper/2506.07600"},"observation_digest":"sha256:391430f13147495f149d5d4d07d153c84c2f3a5354db29db0240354e8d44d1f5","observation_id":"2b4c3222-d80a-40e0-9ff5-6713bb3c1325","resolution":{"observed_at":"2026-08-07T05:35:50.726908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:35:52.093288Z","title":"Unified graph structured models for video understanding","venue":null,"work_id":"95efacfb-fcd7-4159-b70c-fb23b48e2a35","year":2021},"citing_paper":{"arxiv_id":"2506.07600","last_updated":"2025-06-09T10:00:54Z","snapshot_observed_at":"2026-08-19T22:04:44.573189Z","submitted_at":"2025-06-09T10:00:54Z","title":"SceneRAG: Scene-level Retrieval-Augmented Generation for Video Understanding","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:50.732034Z"},"links":{"citing_paper":"/paper/2506.07600"},"observation_digest":"sha256:6c8c57c053a4bea4a80167b36fc3d507d06f3f2311ae20bdd85c021158124d06","observation_id":"4049a5bd-46e6-4991-a9e3-2b1c5d84afce","resolution":{"observed_at":"2026-08-07T05:35:52.098046Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:35:50.736730Z","title":"Self-rag: Learning to retrieve, generate, and critique through self-reflection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07600","last_updated":"2025-06-09T10:00:54Z","snapshot_observed_at":"2026-08-19T22:04:44.573189Z","submitted_at":"2025-06-09T10:00:54Z","title":"SceneRAG: Scene-level Retrieval-Augmented Generation for Video Understanding","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:50.736730Z"},"links":{"citing_paper":"/paper/2506.07600"},"observation_digest":"sha256:852abdfb5964c5f5b3cf2df9a9d91c5d8db5a00ba5190c12dd475ee8a09fce28","observation_id":"b3c25b8a-437b-4dc0-9001-eca88c2a9f25","resolution":{"observed_at":"2026-08-07T05:35:50.736730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:35:52.064872Z","title":"Sharegpt4video: Improving video understanding and generation with better captions.Advances in Neural Information Processing Systems, 37:19472–19495, 2024","venue":null,"work_id":"076ce1a5-60db-4cd1-9965-99354ff06375","year":2024},"citing_paper":{"arxiv_id":"2506.07600","last_updated":"2025-06-09T10:00:54Z","snapshot_observed_at":"2026-08-19T22:04:44.573189Z","submitted_at":"2025-06-09T10:00:54Z","title":"SceneRAG: Scene-level Retrieval-Augmented Generation for Video Understanding","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:50.741138Z"},"links":{"citing_paper":"/paper/2506.07600"},"observation_digest":"sha256:70d3a16eb0b4454193cde982db5c7c5ab72e250091fea2b9e1c204203fe25dcf","observation_id":"4aa681f7-bfa0-43cc-9892-b054964886a7","resolution":{"observed_at":"2026-08-07T05:35:52.070182Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14727","last_updated":"2025-02-20T16:54:07Z","snapshot_observed_at":"2026-08-16T12:56:36.772917Z","submitted_at":"2025-02-20T16:54:07Z","title":"WavRAG: Audio-Integrated Retrieval Augmented Generation for Spoken Dialogue Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14727","snapshot_observed_at":"2026-08-07T05:35:50.746422Z","title":"Wavrag: Audio-integrated retrieval augmented generation for spoken dialogue models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07600","last_updated":"2025-06-09T10:00:54Z","snapshot_observed_at":"2026-08-19T22:04:44.573189Z","submitted_at":"2025-06-09T10:00:54Z","title":"SceneRAG: Scene-level Retrieval-Augmented Generation for Video Understanding","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:50.746422Z"},"links":{"cited_paper":"/paper/2502.14727","citing_paper":"/paper/2506.07600"},"observation_digest":"sha256:a5760780d0cabcbc4b1f2cddf8e156170543df97242e06fc9116e60ad8e6648e","observation_id":"d0bd1e4f-7665-4a89-852b-f07dce6a7fa9","resolution":{"observed_at":"2026-08-07T05:35:50.746422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-08-14T16:25:22.654846Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07476","snapshot_observed_at":"2026-08-07T05:35:50.751331Z","title":"Videollama 2: Advancing spatial-temporal modeling and audio understanding in video-llms.arXiv preprint arXiv:2406.07476, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07600","last_updated":"2025-06-09T10:00:54Z","snapshot_observed_at":"2026-08-19T22:04:44.573189Z","submitted_at":"2025-06-09T10:00:54Z","title":"SceneRAG: Scene-level Retrieval-Augmented Generation for Video Understanding","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:50.751331Z"},"links":{"cited_paper":"/paper/2406.07476","citing_paper":"/paper/2506.07600"},"observation_digest":"sha256:4c8a425f848d315d260a40751b4b71585cf8696209fe1c2e053e9e002fbfcd21","observation_id":"787bbd23-4312-46c8-a59a-1bdd76534d1b","resolution":{"observed_at":"2026-08-07T05:35:50.751331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:35:52.046844Z","title":null,"venue":null,"work_id":"5d1e83d2-c0d4-4a46-991e-129c19f2787d","year":2024},"citing_paper":{"arxiv_id":"2506.07600","last_updated":"2025-06-09T10:00:54Z","snapshot_observed_at":"2026-08-19T22:04:44.573189Z","submitted_at":"2025-06-09T10:00:54Z","title":"SceneRAG: Scene-level Retrieval-Augmented Generation for Video Understanding","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:50.756117Z"},"links":{"citing_paper":"/paper/2506.07600"},"observation_digest":"sha256:dacc1b63b293d84f6dc2db03a3a25ab7411a5e5723557737f527fd2e759c1f17","observation_id":"1d00498a-0c60-4167-9e19-2234800adfc9","resolution":{"observed_at":"2026-08-07T05:35:52.052581Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:35:52.028482Z","title":"Sscformer: Push the limit of chunk-wise conformer for streaming asr using sequentially sampled chunks and chunked causal convolution","venue":null,"work_id":"b0c72c4f-ecc8-4874-a129-899534afcde6","year":null},"citing_paper":{"arxiv_id":"2506.07600","last_updated":"2025-06-09T10:00:54Z","snapshot_observed_at":"2026-08-19T22:04:44.573189Z","submitted_at":"2025-06-09T10:00:54Z","title":"SceneRAG: Scene-level Retrieval-Augmented Generation for Video Understanding","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:50.762345Z"},"links":{"citing_paper":"/paper/2506.07600"},"observation_digest":"sha256:e6666ad4fe4fb4c9ba34dd5e64ff286f334d41a3a14e8d4676110c4cccc46bba","observation_id":"a5ce122e-a137-4c49-a7ca-877690d956bb","resolution":{"observed_at":"2026-08-07T05:35:52.034449Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:35:52.012340Z","title":"Event segmentation and seven types of narrative discontinuity in popular movies.Acta psychologica, 149:69–77, 2014","venue":null,"work_id":"f483848f-f51d-4bc2-9197-d628c5b283be","year":2014},"citing_paper":{"arxiv_id":"2506.07600","last_updated":"2025-06-09T10:00:54Z","snapshot_observed_at":"2026-08-19T22:04:44.573189Z","submitted_at":"2025-06-09T10:00:54Z","title":"SceneRAG: Scene-level Retrieval-Augmented Generation for Video Understanding","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:50.766627Z"},"links":{"citing_paper":"/paper/2506.07600"},"observation_digest":"sha256:77a3cd03e7d7ac1221728abf636bb911d394a23773104266578825b87d0611de","observation_id":"353333cb-08da-4433-80ec-c3f2e8d06b12","resolution":{"observed_at":"2026-08-07T05:35:52.017494Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:35:51.996257Z","title":"Large-scale narrative events in popular cinema","venue":null,"work_id":"09d8a62a-0c75-441e-ac96-f932951dac0c","year":2019},"citing_paper":{"arxiv_id":"2506.07600","last_updated":"2025-06-09T10:00:54Z","snapshot_observed_at":"2026-08-19T22:04:44.573189Z","submitted_at":"2025-06-09T10:00:54Z","title":"SceneRAG: Scene-level Retrieval-Augmented Generation for Video Understanding","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:50.770754Z"},"links":{"citing_paper":"/paper/2506.07600"},"observation_digest":"sha256:3fd68437e4f2b28e7c64c35961fda4af3a43a9a2574ae7e658d200d422759ad9","observation_id":"53b133fe-8f81-4f76-ac9a-d7e0e3ebc3b4","resolution":{"observed_at":"2026-08-07T05:35:52.000990Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16130","last_updated":"2025-02-19T10:49:41Z","snapshot_observed_at":"2026-08-16T12:38:40.131901Z","submitted_at":"2024-04-24T18:38:11Z","title":"From Local to Global: A Graph RAG Approach to Query-Focused Summarization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16130","snapshot_observed_at":"2026-08-07T05:35:50.775173Z","title":"From local to global: A graph rag approach to query-focused summarization.arXiv preprint arXiv:2404.16130, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07600","last_updated":"2025-06-09T10:00:54Z","snapshot_observed_at":"2026-08-19T22:04:44.573189Z","submitted_at":"2025-06-09T10:00:54Z","title":"SceneRAG: Scene-level Retrieval-Augmented Generation for Video Understanding","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:50.775173Z"},"links":{"cited_paper":"/paper/2404.16130","citing_paper":"/paper/2506.07600"},"observation_digest":"sha256:bbb8f392195f3c5d285b2ce03c18aee1f865b73a1f52f32d696f98df5a1dceaf","observation_id":"42d938a9-4bf6-435d-ad1f-ca8e98c3aa5d","resolution":{"observed_at":"2026-08-07T05:35:50.775173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:35:51.980625Z","title":"Videoagent: A memory-augmented multimodal agent for video understanding","venue":null,"work_id":"063491d9-d889-4994-963a-d250ac80f6b7","year":2024},"citing_paper":{"arxiv_id":"2506.07600","last_updated":"2025-06-09T10:00:54Z","snapshot_observed_at":"2026-08-19T22:04:44.573189Z","submitted_at":"2025-06-09T10:00:54Z","title":"SceneRAG: Scene-level Retrieval-Augmented Generation for Video Understanding","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:50.779943Z"},"links":{"citing_paper":"/paper/2506.07600"},"observation_digest":"sha256:54b83f89a010bfb7a406890c7fdfd1247d11a09f08327f95946873480d596936","observation_id":"16cffcf3-1e1b-45a6-83ef-a3abc8e033f4","resolution":{"observed_at":"2026-08-07T05:35:51.985406Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.00430","last_updated":"2023-11-01T10:45:07Z","snapshot_observed_at":"2026-08-19T15:33:09.556542Z","submitted_at":"2023-11-01T10:45:07Z","title":"Distil-Whisper: Robust Knowledge Distillation via Large-Scale Pseudo Labelling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.00430","snapshot_observed_at":"2026-08-07T05:35:50.784040Z","title":"Distil-whisper: Robust knowledge distillation via large-scale pseudo labelling.arXiv preprint arXiv:2311.00430, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07600","last_updated":"2025-06-09T10:00:54Z","snapshot_observed_at":"2026-08-19T22:04:44.573189Z","submitted_at":"2025-06-09T10:00:54Z","title":"SceneRAG: Scene-level Retrieval-Augmented Generation for Video Understanding","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:50.784040Z"},"links":{"cited_paper":"/paper/2311.00430","citing_paper":"/paper/2506.07600"},"observation_digest":"sha256:267641b5b2758d90a4a40213a9c031937b86c79de3ced81c5372b61b3d79c678","observation_id":"2616490e-330d-4164-ad63-ef68cacedb31","resolution":{"observed_at":"2026-08-07T05:35:50.784040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.10997","last_updated":"2024-03-27T09:16:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-18T07:47:33Z","title":"Retrieval-Augmented Generation for Large Language Models: A Survey","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.10997","snapshot_observed_at":"2026-08-07T05:35:50.788520Z","title":"Retrieval-augmented generation for large language models: A survey.arXiv preprint arXiv:2312.10997, 2:1, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07600","last_updated":"2025-06-09T10:00:54Z","snapshot_observed_at":"2026-08-19T22:04:44.573189Z","submitted_at":"2025-06-09T10:00:54Z","title":"SceneRAG: Scene-level Retrieval-Augmented Generation for Video Understanding","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:50.788520Z"},"links":{"cited_paper":"/paper/2312.10997","citing_paper":"/paper/2506.07600"},"observation_digest":"sha256:86f917ed51176b02c3caa3b3b1271fdea55d9b0ba523741148b045b12e306513","observation_id":"c1cab8fa-f191-40aa-9038-3dd0efdbfaf9","resolution":{"observed_at":"2026-08-07T05:35:50.788520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:35:50.793225Z","title":"Imagebind: One embedding space to bind them all","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07600","last_updated":"2025-06-09T10:00:54Z","snapshot_observed_at":"2026-08-19T22:04:44.573189Z","submitted_at":"2025-06-09T10:00:54Z","title":"SceneRAG: Scene-level Retrieval-Augmented Generation for Video Understanding","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:50.793225Z"},"links":{"citing_paper":"/paper/2506.07600"},"observation_digest":"sha256:8abb77a915cea10b9ee1c7a600a01800557e7fa0514bf1656049ecccae3e68cc","observation_id":"de8acc01-3b82-452f-92dd-3ba6f04c347f","resolution":{"observed_at":"2026-08-07T05:35:50.793225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:35:50.797523Z","title":"Lightrag: Simple and fast retrieval-augmented generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07600","last_updated":"2025-06-09T10:00:54Z","snapshot_observed_at":"2026-08-19T22:04:44.573189Z","submitted_at":"2025-06-09T10:00:54Z","title":"SceneRAG: Scene-level Retrieval-Augmented Generation for Video Understanding","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:50.797523Z"},"links":{"citing_paper":"/paper/2506.07600"},"observation_digest":"sha256:14f811ad8a5a9847409e7264f294ecdbace026e75c654122e4e47d59e3c845e4","observation_id":"1c4d502e-b1bd-405a-8c0c-27d89342ab2e","resolution":{"observed_at":"2026-08-07T05:35:50.797523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05874","last_updated":"2025-05-28T18:14:55Z","snapshot_observed_at":"2026-08-20T12:11:15.199558Z","submitted_at":"2025-01-10T11:17:15Z","title":"VideoRAG: Retrieval-Augmented Generation over Video Corpus","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.05874","snapshot_observed_at":"2026-08-07T05:35:50.801689Z","title":"Videorag: Retrieval- augmented generation over video corpus.arXiv preprint arXiv:2501.05874, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07600","last_updated":"2025-06-09T10:00:54Z","snapshot_observed_at":"2026-08-19T22:04:44.573189Z","submitted_at":"2025-06-09T10:00:54Z","title":"SceneRAG: Scene-level Retrieval-Augmented Generation for Video Understanding","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:50.801689Z"},"links":{"cited_paper":"/paper/2501.05874","citing_paper":"/paper/2506.07600"},"observation_digest":"sha256:2ef97a36dd9e57ad4b5d6e701975de7a6206837266da469cd1a99f335da30d30","observation_id":"8590ccea-a560-4f54-a566-bd67cde45dde","resolution":{"observed_at":"2026-08-07T05:35:50.801689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:35:51.943192Z","title":"Learning temporal video procedure segmentation from an automatically collected large dataset","venue":null,"work_id":"39cdf2ff-947f-4c8b-aba7-7671eb318df4","year":2022},"citing_paper":{"arxiv_id":"2506.07600","last_updated":"2025-06-09T10:00:54Z","snapshot_observed_at":"2026-08-19T22:04:44.573189Z","submitted_at":"2025-06-09T10:00:54Z","title":"SceneRAG: Scene-level Retrieval-Augmented Generation for Video Understanding","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:50.806583Z"},"links":{"citing_paper":"/paper/2506.07600"},"observation_digest":"sha256:7f9366de7df2a6f6fdf6a8dca85b61290b0c4608ccf93ce763c5dc81ea32063d","observation_id":"5fa4fc56-0f84-4871-994c-fa8357254b9c","resolution":{"observed_at":"2026-08-07T05:35:51.948243Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:35:51.927058Z","title":"Diffusionret: Generative text-video retrieval with diffusion model","venue":null,"work_id":"280d2143-6fb4-4c11-8d95-ececd2b4a447","year":2023},"citing_paper":{"arxiv_id":"2506.07600","last_updated":"2025-06-09T10:00:54Z","snapshot_observed_at":"2026-08-19T22:04:44.573189Z","submitted_at":"2025-06-09T10:00:54Z","title":"SceneRAG: Scene-level Retrieval-Augmented Generation for Video Understanding","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:50.810986Z"},"links":{"citing_paper":"/paper/2506.07600"},"observation_digest":"sha256:b9a4317eed6007ddfaaa6d2e24b3e48a1c1b45b214cc637d32643a6066d99c8f","observation_id":"3c713945-46a5-408d-acb2-a0ecf0d7a903","resolution":{"observed_at":"2026-08-07T05:35:51.932126Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12648","last_updated":"2024-05-21T09:56:48Z","snapshot_observed_at":"2026-08-16T13:51:01.966830Z","submitted_at":"2024-05-21T09:56:48Z","title":"Scene Graph Generation Strategy with Co-occurrence Knowledge and Learnable Term Frequency","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.12648","snapshot_observed_at":"2026-08-07T05:35:50.815034Z","title":"Scene graph generation strategy with co-occurrence knowledge and learnable term frequency.arXiv preprint arXiv:2405.12648, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07600","last_updated":"2025-06-09T10:00:54Z","snapshot_observed_at":"2026-08-19T22:04:44.573189Z","submitted_at":"2025-06-09T10:00:54Z","title":"SceneRAG: Scene-level Retrieval-Augmented Generation for Video Understanding","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:50.815034Z"},"links":{"cited_paper":"/paper/2405.12648","citing_paper":"/paper/2506.07600"},"observation_digest":"sha256:b0458481b6872a4e9bbfbdeda1b793b84278e4554c7dd0cc5e57d31d06a5e7a8","observation_id":"ed6b7bfa-2166-4a9b-93b6-5f8e8ff72f6e","resolution":{"observed_at":"2026-08-07T05:35:50.815034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02030","last_updated":"2024-06-05T03:28:01Z","snapshot_observed_at":"2026-08-16T13:46:25.413359Z","submitted_at":"2024-06-04T07:13:23Z","title":"Multimodal Reasoning with Multimodal Knowledge Graph","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02030","snapshot_observed_at":"2026-08-07T05:35:50.819345Z","title":"Multimodal reasoning with multimodal knowledge graph.arXiv preprint arXiv:2406.02030, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07600","last_updated":"2025-06-09T10:00:54Z","snapshot_observed_at":"2026-08-19T22:04:44.573189Z","submitted_at":"2025-06-09T10:00:54Z","title":"SceneRAG: Scene-level Retrieval-Augmented Generation for Video Understanding","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:50.819345Z"},"links":{"cited_paper":"/paper/2406.02030","citing_paper":"/paper/2506.07600"},"observation_digest":"sha256:85a9a3db1022f39764bbbace76802847fc2b98777459f01f336068ea2843a865","observation_id":"6c089fd8-d280-4021-97cd-dbdd99f5ce81","resolution":{"observed_at":"2026-08-07T05:35:50.819345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:35:50.823707Z","title":"Retrieval-augmented generation for knowledge-intensive nlp tasks.Advances in neural information processing systems, 33:9459–9474, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.07600","last_updated":"2025-06-09T10:00:54Z","snapshot_observed_at":"2026-08-19T22:04:44.573189Z","submitted_at":"2025-06-09T10:00:54Z","title":"SceneRAG: Scene-level Retrieval-Augmented Generation for Video Understanding","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:50.823707Z"},"links":{"citing_paper":"/paper/2506.07600"},"observation_digest":"sha256:d57090340ba7c3cb0606cfa209854c66944974c21b71c7346f3a14edaacdac78","observation_id":"351fcb6e-6148-4978-b96e-70ca201633ab","resolution":{"observed_at":"2026-08-07T05:35:50.823707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:35:50.828025Z","title":"Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.07600","last_updated":"2025-06-09T10:00:54Z","snapshot_observed_at":"2026-08-19T22:04:44.573189Z","submitted_at":"2025-06-09T10:00:54Z","title":"SceneRAG: Scene-level Retrieval-Augmented Generation for Video Understanding","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:50.828025Z"},"links":{"citing_paper":"/paper/2506.07600"},"observation_digest":"sha256:21e41e453342a22cfa7f45a13c9bc3a0130ff6791a0a7c935867a8e407eadff1","observation_id":"b98855b0-59d2-4594-862a-32d7436c411f","resolution":{"observed_at":"2026-08-07T05:35:50.828025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06355","last_updated":"2024-01-04T02:06:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-10T17:59:04Z","title":"VideoChat: Chat-Centric Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06355","snapshot_observed_at":"2026-08-07T05:35:50.832358Z","title":"Videochat: Chat-centric video understanding.arXiv preprint arXiv:2305.06355, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07600","last_updated":"2025-06-09T10:00:54Z","snapshot_observed_at":"2026-08-19T22:04:44.573189Z","submitted_at":"2025-06-09T10:00:54Z","title":"SceneRAG: Scene-level Retrieval-Augmented Generation for Video Understanding","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:50.832358Z"},"links":{"cited_paper":"/paper/2305.06355","citing_paper":"/paper/2506.07600"},"observation_digest":"sha256:a1028568d86838bf942e95339171c224ef38a4b04057ac422e1edefaff36bdb7","observation_id":"c19432be-2e3c-44ab-82f5-9ad99d1453ae","resolution":{"observed_at":"2026-08-07T05:35:50.832358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:35:50.837354Z","title":"Llama-vid: An image is worth 2 tokens in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07600","last_updated":"2025-06-09T10:00:54Z","snapshot_observed_at":"2026-08-19T22:04:44.573189Z","submitted_at":"2025-06-09T10:00:54Z","title":"SceneRAG: Scene-level Retrieval-Augmented Generation for Video Understanding","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:50.837354Z"},"links":{"citing_paper":"/paper/2506.07600"},"observation_digest":"sha256:c238e29aa2a419562bc23a05b0290eea2318c73f67fb9b19070116ebff85991c","observation_id":"5542f591-d7eb-4a35-9ee4-6c374c36ef95","resolution":{"observed_at":"2026-08-07T05:35:50.837354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.06353","last_updated":"2020-09-15T13:27:13Z","snapshot_observed_at":"2026-08-20T14:57:57.265840Z","submitted_at":"2020-02-15T10:03:25Z","title":"UniVL: A Unified Video and Language Pre-Training Model for Multimodal Understanding and Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.06353","snapshot_observed_at":"2026-08-07T05:35:50.842483Z","title":"Univl: A unified video and language pre-training model for multimodal understanding and generation.arXiv preprint arXiv:2002.06353, 2020","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2506.07600","last_updated":"2025-06-09T10:00:54Z","snapshot_observed_at":"2026-08-19T22:04:44.573189Z","submitted_at":"2025-06-09T10:00:54Z","title":"SceneRAG: Scene-level Retrieval-Augmented Generation for Video Understanding","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:50.842483Z"},"links":{"cited_paper":"/paper/2002.06353","citing_paper":"/paper/2506.07600"},"observation_digest":"sha256:be43644bc2447daca3037a12e64c2436e4e68ae1dfc6f577a56dc5e4cf590506","observation_id":"8bde4f57-de10-42fb-a65a-61b852cbd1d7","resolution":{"observed_at":"2026-08-07T05:35:50.842483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:35:51.877569Z","title":"The impact of continuity editing in narrative film on event segmentation.Cognitive science, 35(8):1489–1517, 2011","venue":null,"work_id":"4d3da89d-5958-4e5b-8e31-b21d3847c8f7","year":2011},"citing_paper":{"arxiv_id":"2506.07600","last_updated":"2025-06-09T10:00:54Z","snapshot_observed_at":"2026-08-19T22:04:44.573189Z","submitted_at":"2025-06-09T10:00:54Z","title":"SceneRAG: Scene-level Retrieval-Augmented Generation for Video Understanding","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:50.847978Z"},"links":{"citing_paper":"/paper/2506.07600"},"observation_digest":"sha256:16fe04b27a9e8d62603f719a4daf9d4d3fb769d0113d60d63bfa7c46b5a36447","observation_id":"13c512e3-d06d-4697-80a8-633f478325e7","resolution":{"observed_at":"2026-08-07T05:35:51.883271Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:35:51.861025Z","title":"Learning joint embedding with multimodal cues for cross-modal video-text retrieval","venue":null,"work_id":"74381ef9-c2d1-44b1-a077-2bfd5ee9442e","year":2018},"citing_paper":{"arxiv_id":"2506.07600","last_updated":"2025-06-09T10:00:54Z","snapshot_observed_at":"2026-08-19T22:04:44.573189Z","submitted_at":"2025-06-09T10:00:54Z","title":"SceneRAG: Scene-level Retrieval-Augmented Generation for Video Understanding","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:50.852386Z"},"links":{"citing_paper":"/paper/2506.07600"},"observation_digest":"sha256:29930c44cf0410e50e6c2c2730a36a24875a657badb265501b15599362d9017c","observation_id":"06cd2825-1733-4f1c-b7ce-5c6ed7b1e87f","resolution":{"observed_at":"2026-08-07T05:35:51.866744Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.05277","last_updated":"2022-01-14T02:14:07Z","snapshot_observed_at":"2026-08-16T17:28:26.420145Z","submitted_at":"2022-01-14T02:14:07Z","title":"Boundary-aware Self-supervised Learning for Video Scene Segmentation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.05277","snapshot_observed_at":"2026-08-07T05:35:50.858475Z","title":"Boundary-aware self-supervised learning for video scene segmentation.arXiv preprint arXiv:2201.05277, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.07600","last_updated":"2025-06-09T10:00:54Z","snapshot_observed_at":"2026-08-19T22:04:44.573189Z","submitted_at":"2025-06-09T10:00:54Z","title":"SceneRAG: Scene-level Retrieval-Augmented Generation for Video Understanding","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:50.858475Z"},"links":{"cited_paper":"/paper/2201.05277","citing_paper":"/paper/2506.07600"},"observation_digest":"sha256:73ed103e41b9d44779a8ff50a95e6e3c2a8f493846ef2e1285e420e90f8d1447","observation_id":"bc233881-faed-4732-8fd9-8fe0c8ade76d","resolution":{"observed_at":"2026-08-07T05:35:50.858475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:35:51.844122Z","title":"Video shot boundary detection: a review","venue":null,"work_id":"153ce323-0330-40a9-91da-6400788f0f81","year":2015},"citing_paper":{"arxiv_id":"2506.07600","last_updated":"2025-06-09T10:00:54Z","snapshot_observed_at":"2026-08-19T22:04:44.573189Z","submitted_at":"2025-06-09T10:00:54Z","title":"SceneRAG: Scene-level Retrieval-Augmented Generation for Video Understanding","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:50.863274Z"},"links":{"citing_paper":"/paper/2506.07600"},"observation_digest":"sha256:3da859b89d25d0dd036c748ec6b6a27661ed7c9d742daecd263aac751e942895","observation_id":"4ffcb655-c661-401a-9aee-a54baf56b1ce","resolution":{"observed_at":"2026-08-07T05:35:51.849862Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:35:51.827095Z","title":"What is a multi-modal knowledge graph: A survey.Big Data Research, 32:100380, 2023","venue":null,"work_id":"ab56feec-d025-4d24-9a5f-bc4fb614522f","year":2023},"citing_paper":{"arxiv_id":"2506.07600","last_updated":"2025-06-09T10:00:54Z","snapshot_observed_at":"2026-08-19T22:04:44.573189Z","submitted_at":"2025-06-09T10:00:54Z","title":"SceneRAG: Scene-level Retrieval-Augmented Generation for Video Understanding","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:50.867733Z"},"links":{"citing_paper":"/paper/2506.07600"},"observation_digest":"sha256:5166ca82740fd8a4e084f6b973d5f83ed5e13cd22045189a3246adbc496ecd7e","observation_id":"62a16ffe-9666-4ddb-8c19-34f9ce839849","resolution":{"observed_at":"2026-08-07T05:35:51.832449Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:35:50.872103Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.07600","last_updated":"2025-06-09T10:00:54Z","snapshot_observed_at":"2026-08-19T22:04:44.573189Z","submitted_at":"2025-06-09T10:00:54Z","title":"SceneRAG: Scene-level Retrieval-Augmented Generation for Video Understanding","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:50.872103Z"},"links":{"citing_paper":"/paper/2506.07600"},"observation_digest":"sha256:4999105ac353e5d41a9274f15630b6b7de89ff5cbec2af2e7308a0e44372b01e","observation_id":"0e5e5683-a5e7-4451-a79b-9e0c6bf79174","resolution":{"observed_at":"2026-08-07T05:35:50.872103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:35:50.876870Z","title":"Robust speech recognition via large-scale weak supervision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07600","last_updated":"2025-06-09T10:00:54Z","snapshot_observed_at":"2026-08-19T22:04:44.573189Z","submitted_at":"2025-06-09T10:00:54Z","title":"SceneRAG: Scene-level Retrieval-Augmented Generation for Video Understanding","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:50.876870Z"},"links":{"citing_paper":"/paper/2506.07600"},"observation_digest":"sha256:0a4f942ed618c3fb4f58f720217235fb9509c8a7238560f4ca62dc746a8261b9","observation_id":"0c2e3e7c-3ea5-4db7-ba22-9e6a489e87bc","resolution":{"observed_at":"2026-08-07T05:35:50.876870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01549","last_updated":"2025-02-03T17:30:19Z","snapshot_observed_at":"2026-08-16T17:14:52.364919Z","submitted_at":"2025-02-03T17:30:19Z","title":"VideoRAG: Retrieval-Augmented Generation with Extreme Long-Context Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.01549","snapshot_observed_at":"2026-08-07T05:35:50.881284Z","title":"Videorag: Retrieval-augmented generation with extreme long-context videos.arXiv preprint arXiv:2502.01549, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07600","last_updated":"2025-06-09T10:00:54Z","snapshot_observed_at":"2026-08-19T22:04:44.573189Z","submitted_at":"2025-06-09T10:00:54Z","title":"SceneRAG: Scene-level Retrieval-Augmented Generation for Video Understanding","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:50.881284Z"},"links":{"cited_paper":"/paper/2502.01549","citing_paper":"/paper/2506.07600"},"observation_digest":"sha256:8e1df94c27666e83c1c5e328e6fd2e0804904f47f4654ab3213b83ed4ea69d89","observation_id":"569ffada-7c69-455a-ba47-b05e7ad7e021","resolution":{"observed_at":"2026-08-07T05:35:50.881284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:35:51.787459Z","title":"Temporal video segmentation to scenes using high-level audiovisual features.IEEE Transactions on Circuits and Systems for Video Technology, 21(8):1163–1177, 2011","venue":null,"work_id":"f0f71412-72fd-464a-b1aa-88c2557376c0","year":2011},"citing_paper":{"arxiv_id":"2506.07600","last_updated":"2025-06-09T10:00:54Z","snapshot_observed_at":"2026-08-19T22:04:44.573189Z","submitted_at":"2025-06-09T10:00:54Z","title":"SceneRAG: Scene-level Retrieval-Augmented Generation for Video Understanding","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:50.885872Z"},"links":{"citing_paper":"/paper/2506.07600"},"observation_digest":"sha256:28e494033570ef627fbce7c8b9425cfd0a781a02985417143758d483ea4aeb5b","observation_id":"3bf78b05-a0ad-4f6c-bd63-585137abeb79","resolution":{"observed_at":"2026-08-07T05:35:51.792701Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:35:51.770537Z","title":"Videobert: A joint model for video and language representation learning","venue":null,"work_id":"0672ca1d-7764-4c51-a0c2-cb3148c97782","year":2019},"citing_paper":{"arxiv_id":"2506.07600","last_updated":"2025-06-09T10:00:54Z","snapshot_observed_at":"2026-08-19T22:04:44.573189Z","submitted_at":"2025-06-09T10:00:54Z","title":"SceneRAG: Scene-level Retrieval-Augmented Generation for Video Understanding","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:50.890403Z"},"links":{"citing_paper":"/paper/2506.07600"},"observation_digest":"sha256:f2e7826a848475d65d8cb4f9869079a4ed7e95182578fae457cea569cad3f537","observation_id":"dfd66a0f-e71e-4f30-b259-61b9958a83e3","resolution":{"observed_at":"2026-08-07T05:35:51.775488Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:35:51.753668Z","title":"Temporal scene montage for self- supervised video scene boundary detection.ACM Transactions on Multimedia Computing, Communi- cations and Applications, 20(7):1–19, 2024","venue":null,"work_id":"835a28e9-0482-43ff-b4fa-1992c084a4ca","year":2024},"citing_paper":{"arxiv_id":"2506.07600","last_updated":"2025-06-09T10:00:54Z","snapshot_observed_at":"2026-08-19T22:04:44.573189Z","submitted_at":"2025-06-09T10:00:54Z","title":"SceneRAG: Scene-level Retrieval-Augmented Generation for Video Understanding","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:50.894622Z"},"links":{"citing_paper":"/paper/2506.07600"},"observation_digest":"sha256:960cd6b19ac09d03b73c040bcb021964b5c8b028760350c274860c5b05eac428","observation_id":"9a62d48e-553a-420c-b665-e452fc124e47","resolution":{"observed_at":"2026-08-07T05:35:51.758787Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:35:50.898518Z","title":"Videoagent: Long-form video understanding with large language model as agent","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07600","last_updated":"2025-06-09T10:00:54Z","snapshot_observed_at":"2026-08-19T22:04:44.573189Z","submitted_at":"2025-06-09T10:00:54Z","title":"SceneRAG: Scene-level Retrieval-Augmented Generation for Video Understanding","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:50.898518Z"},"links":{"citing_paper":"/paper/2506.07600"},"observation_digest":"sha256:5f08dd385560dcb366eabdba376875c71a602a12ef0b2fddb886360f451f7671","observation_id":"7d489f82-4221-48ca-93fe-4945e8906294","resolution":{"observed_at":"2026-08-07T05:35:50.898518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:35:51.726981Z","title":"Scene consistency representation learning for video scene segmentation","venue":null,"work_id":"7c10d83d-ee2a-4d97-b6f1-ad1f81a7b602","year":2022},"citing_paper":{"arxiv_id":"2506.07600","last_updated":"2025-06-09T10:00:54Z","snapshot_observed_at":"2026-08-19T22:04:44.573189Z","submitted_at":"2025-06-09T10:00:54Z","title":"SceneRAG: Scene-level Retrieval-Augmented Generation for Video Understanding","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:50.902567Z"},"links":{"citing_paper":"/paper/2506.07600"},"observation_digest":"sha256:ae5e4082fb8445728f3340b2a577a52358071b24c062f73116ce6719381fe328","observation_id":"539bc9a7-3595-46ab-8a8e-871564008167","resolution":{"observed_at":"2026-08-07T05:35:51.731995Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.14084","last_updated":"2021-10-01T15:13:27Z","snapshot_observed_at":"2026-08-20T22:36:41.628644Z","submitted_at":"2021-09-28T23:01:51Z","title":"VideoCLIP: Contrastive Pre-training for Zero-shot Video-Text Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.14084","snapshot_observed_at":"2026-08-07T05:35:50.906801Z","title":"Videoclip: Contrastive pre-training for zero-shot video-text understanding.arXiv preprint arXiv:2109.14084, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.07600","last_updated":"2025-06-09T10:00:54Z","snapshot_observed_at":"2026-08-19T22:04:44.573189Z","submitted_at":"2025-06-09T10:00:54Z","title":"SceneRAG: Scene-level Retrieval-Augmented Generation for Video Understanding","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:50.906801Z"},"links":{"cited_paper":"/paper/2109.14084","citing_paper":"/paper/2506.07600"},"observation_digest":"sha256:6e03a204a7d8447ee5c85ef25a0c7def54ec15cb1e623cf14ac98b6219b8f43a","observation_id":"bbecc0ac-db34-4231-bf89-b3a95d52059a","resolution":{"observed_at":"2026-08-07T05:35:50.906801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:35:51.710337Z","title":"Retrieval- augmented egocentric video captioning","venue":null,"work_id":"db316cf6-dac3-4d1c-9fae-1773cd64c744","year":2024},"citing_paper":{"arxiv_id":"2506.07600","last_updated":"2025-06-09T10:00:54Z","snapshot_observed_at":"2026-08-19T22:04:44.573189Z","submitted_at":"2025-06-09T10:00:54Z","title":"SceneRAG: Scene-level Retrieval-Augmented Generation for Video Understanding","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:50.911215Z"},"links":{"citing_paper":"/paper/2506.07600"},"observation_digest":"sha256:3da2e76292e8ed62147fdaf6a67d0b00d28a86d825c36bd2285ecf90d1532a06","observation_id":"417c172f-13e5-4862-81ef-0eff5edd6e6a","resolution":{"observed_at":"2026-08-07T05:35:51.715997Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-08-21T07:48:51.700518Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-07T05:35:50.915326Z","title":"Minicpm-v: A gpt-4v level mllm on your phone.arXiv preprint arXiv:2408.01800, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07600","last_updated":"2025-06-09T10:00:54Z","snapshot_observed_at":"2026-08-19T22:04:44.573189Z","submitted_at":"2025-06-09T10:00:54Z","title":"SceneRAG: Scene-level Retrieval-Augmented Generation for Video Understanding","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:50.915326Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2506.07600"},"observation_digest":"sha256:ac9a072c032c989005b7d5124bf8f3813689b2e887751cc5205bdd172ae5c1ed","observation_id":"b844bde7-bfd0-42a9-b90a-90514f00b513","resolution":{"observed_at":"2026-08-07T05:35:50.915326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:35:50.920388Z","title":"Momentseeker: A comprehensive benchmark and a strong baseline for moment retrieval within long videos.arXiv preprint arXiv:2502.12558, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07600","last_updated":"2025-06-09T10:00:54Z","snapshot_observed_at":"2026-08-19T22:04:44.573189Z","submitted_at":"2025-06-09T10:00:54Z","title":"SceneRAG: Scene-level Retrieval-Augmented Generation for Video Understanding","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:50.920388Z"},"links":{"citing_paper":"/paper/2506.07600"},"observation_digest":"sha256:8c1a79e61a9569b581b036b206a6bb39035cc9b99c328d315889502d0e7a1912","observation_id":"e7a23ea1-dcb5-4a6d-a212-4b6c0bf8ac72","resolution":{"observed_at":"2026-08-07T05:35:50.920388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:35:51.694000Z","title":"A formal study of shot boundary detection.IEEE transactions on circuits and systems for video technology, 17(2):168–186, 2007","venue":null,"work_id":"490e6d93-a6da-47ef-b27b-c26af5876cc1","year":2007},"citing_paper":{"arxiv_id":"2506.07600","last_updated":"2025-06-09T10:00:54Z","snapshot_observed_at":"2026-08-19T22:04:44.573189Z","submitted_at":"2025-06-09T10:00:54Z","title":"SceneRAG: Scene-level Retrieval-Augmented Generation for Video Understanding","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:50.924862Z"},"links":{"citing_paper":"/paper/2506.07600"},"observation_digest":"sha256:865c165ce46f015751d1dbfef840cd4178d7c81e52f79baab7339e35930ecfcf","observation_id":"3d972c0f-14f9-4ff4-87b8-55fc80973776","resolution":{"observed_at":"2026-08-07T05:35:51.699263Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:35:51.678121Z","title":"The brain’s cutting- room floor: Segmentation of narrative cinema.Frontiers in human neuroscience, 4:168, 2010","venue":null,"work_id":"6c89883a-d361-4e8c-b5cb-d421013a703d","year":2010},"citing_paper":{"arxiv_id":"2506.07600","last_updated":"2025-06-09T10:00:54Z","snapshot_observed_at":"2026-08-19T22:04:44.573189Z","submitted_at":"2025-06-09T10:00:54Z","title":"SceneRAG: Scene-level Retrieval-Augmented Generation for Video Understanding","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:50.929441Z"},"links":{"citing_paper":"/paper/2506.07600"},"observation_digest":"sha256:a73d05dfebedd1b4518f96d4fbce395f072be28e1df017b95704af25c7bcc822","observation_id":"8cdd8dc1-7a4b-429b-b457-13c683723b0f","resolution":{"observed_at":"2026-08-07T05:35:51.683472Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:35:51.662129Z","title":"Merlot reserve: Neural script knowledge through vision and language and sound","venue":null,"work_id":"8306f5b9-a326-406e-890f-930d5edd30b5","year":2022},"citing_paper":{"arxiv_id":"2506.07600","last_updated":"2025-06-09T10:00:54Z","snapshot_observed_at":"2026-08-19T22:04:44.573189Z","submitted_at":"2025-06-09T10:00:54Z","title":"SceneRAG: Scene-level Retrieval-Augmented Generation for Video Understanding","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:50.935121Z"},"links":{"citing_paper":"/paper/2506.07600"},"observation_digest":"sha256:1adbaf3bc2458a74e9f4461b963a7b9fcf9a4d25f4ad0b75069721c0a827fdd7","observation_id":"94805a66-2b73-4012-b5ab-e94a4f8e294d","resolution":{"observed_at":"2026-08-07T05:35:51.667190Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.09823","last_updated":"2025-04-14T02:47:23Z","snapshot_observed_at":"2026-08-20T11:16:55.065623Z","submitted_at":"2025-04-14T02:47:23Z","title":"RAKG:Document-level Retrieval Augmented Knowledge Graph Construction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.09823","snapshot_observed_at":"2026-08-07T05:35:50.939358Z","title":"Rakg: Document-level retrieval augmented knowledge graph construction.arXiv preprint arXiv:2504.09823, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07600","last_updated":"2025-06-09T10:00:54Z","snapshot_observed_at":"2026-08-19T22:04:44.573189Z","submitted_at":"2025-06-09T10:00:54Z","title":"SceneRAG: Scene-level Retrieval-Augmented Generation for Video Understanding","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:50.939358Z"},"links":{"cited_paper":"/paper/2504.09823","citing_paper":"/paper/2506.07600"},"observation_digest":"sha256:d399eac333237893e62f8b1125bbc242875ae5e3558e2845d29414304d14d83f","observation_id":"74bf6da5-efe4-415c-8d58-fe897a7d3590","resolution":{"observed_at":"2026-08-07T05:35:50.939358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02858","last_updated":"2023-10-25T06:23:31Z","snapshot_observed_at":"2026-08-13T15:50:38.254753Z","submitted_at":"2023-06-05T13:17:27Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02858","snapshot_observed_at":"2026-08-07T05:35:50.943960Z","title":"Video-llama: An instruction-tuned audio-visual language model for video understanding.arXiv preprint arXiv:2306.02858, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07600","last_updated":"2025-06-09T10:00:54Z","snapshot_observed_at":"2026-08-19T22:04:44.573189Z","submitted_at":"2025-06-09T10:00:54Z","title":"SceneRAG: Scene-level Retrieval-Augmented Generation for Video Understanding","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:50.943960Z"},"links":{"cited_paper":"/paper/2306.02858","citing_paper":"/paper/2506.07600"},"observation_digest":"sha256:c82c69d715dcf9d5c0a1f34365662a208dd8756e243e434a4c0cca58e265567c","observation_id":"6722b5b0-1c8d-4a75-a47b-60ab28d58aa8","resolution":{"observed_at":"2026-08-07T05:35:50.943960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:35:51.590105Z","title":"Please maintain the required format in your response","venue":null,"work_id":"72103f65-fac4-4beb-8221-f727d664f4e6","year":null},"citing_paper":{"arxiv_id":"2506.07600","last_updated":"2025-06-09T10:00:54Z","snapshot_observed_at":"2026-08-19T22:04:44.573189Z","submitted_at":"2025-06-09T10:00:54Z","title":"SceneRAG: Scene-level Retrieval-Augmented Generation for Video Understanding","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:50.967095Z"},"links":{"citing_paper":"/paper/2506.07600"},"observation_digest":"sha256:db070c3f22ceeb1a9c6439698b7232ff7d0eb3984d89ce1f953c27a710bd8447","observation_id":"8ff9f0a4-ca16-4e0f-a52a-b64249c31166","resolution":{"observed_at":"2026-08-07T05:35:51.595091Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:35:51.642030Z","title":null,"venue":null,"work_id":"cfe19b2d-6ffe-4ff9-8712-931e0966c5ef","year":null},"citing_paper":{"arxiv_id":"2506.07600","last_updated":"2025-06-09T10:00:54Z","snapshot_observed_at":"2026-08-19T22:04:44.573189Z","submitted_at":"2025-06-09T10:00:54Z","title":"SceneRAG: Scene-level Retrieval-Augmented Generation for Video Understanding","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:50.971971Z"},"links":{"citing_paper":"/paper/2506.07600"},"observation_digest":"sha256:76734eca0a76ac22e949c4ab0b2d9069f646bdfff7c570d8480ed807d620c0c1","observation_id":"66e0bc2a-77d6-4210-af0d-cb3bf0ebfd8c","resolution":{"observed_at":"2026-08-07T05:35:51.650621Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:35:51.555891Z","title":"Please maintain the required format in your response","venue":null,"work_id":"01569010-772c-41ac-b397-f30c05b7df74","year":null},"citing_paper":{"arxiv_id":"2506.07600","last_updated":"2025-06-09T10:00:54Z","snapshot_observed_at":"2026-08-19T22:04:44.573189Z","submitted_at":"2025-06-09T10:00:54Z","title":"SceneRAG: Scene-level Retrieval-Augmented Generation for Video Understanding","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:50.989912Z"},"links":{"citing_paper":"/paper/2506.07600"},"observation_digest":"sha256:86157259150bb9519778dd764a308ba3de953e52b360a0129246040adc219741","observation_id":"5b9ec369-cc81-4154-bc82-1272e2439b41","resolution":{"observed_at":"2026-08-07T05:35:51.560866Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:35:51.531198Z","title":null,"venue":null,"work_id":"a8a7b454-c890-4d30-93e8-37561d4b866d","year":null},"citing_paper":{"arxiv_id":"2506.07600","last_updated":"2025-06-09T10:00:54Z","snapshot_observed_at":"2026-08-19T22:04:44.573189Z","submitted_at":"2025-06-09T10:00:54Z","title":"SceneRAG: Scene-level Retrieval-Augmented Generation for Video Understanding","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:50.994061Z"},"links":{"citing_paper":"/paper/2506.07600"},"observation_digest":"sha256:373d74d252cdec93eecaa02f9b3f3ec9acfb9baf02a3c8c75c34edb329cc7e83","observation_id":"7353939f-dbf5-4101-88c7-32311ade0fd3","resolution":{"observed_at":"2026-08-07T05:35:51.536324Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:35:51.624871Z","title":null,"venue":null,"work_id":"57c18f10-bff3-4587-8df4-27bae73b25f8","year":null},"citing_paper":{"arxiv_id":"2506.07600","last_updated":"2025-06-09T10:00:54Z","snapshot_observed_at":"2026-08-19T22:04:44.573189Z","submitted_at":"2025-06-09T10:00:54Z","title":"SceneRAG: Scene-level Retrieval-Augmented Generation for Video Understanding","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:50.998519Z"},"links":{"citing_paper":"/paper/2506.07600"},"observation_digest":"sha256:cfae9cfbac00653a7e275aec52662815dc6b55901456d4e8f8c245c1eeb309b4","observation_id":"39d875e6-f1c9-4291-9ae0-0c50abad866e","resolution":{"observed_at":"2026-08-07T05:35:51.629732Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:35:51.607607Z","title":null,"venue":null,"work_id":"88d9b054-3fa2-4375-a784-a1d4ebcac3af","year":null},"citing_paper":{"arxiv_id":"2506.07600","last_updated":"2025-06-09T10:00:54Z","snapshot_observed_at":"2026-08-19T22:04:44.573189Z","submitted_at":"2025-06-09T10:00:54Z","title":"SceneRAG: Scene-level Retrieval-Augmented Generation for Video Understanding","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:51.002426Z"},"links":{"citing_paper":"/paper/2506.07600"},"observation_digest":"sha256:c2d966fc191ecc55d7e13acb56b1306ddae9ff2d93fe358e7e7edd389bf89707","observation_id":"bf189050-0e90-4dd1-835d-073c1343bfd4","resolution":{"observed_at":"2026-08-07T05:35:51.612920Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:35:51.573297Z","title":null,"venue":null,"work_id":"7e1497c9-5218-42cf-a584-777b2659e29c","year":null},"citing_paper":{"arxiv_id":"2506.07600","last_updated":"2025-06-09T10:00:54Z","snapshot_observed_at":"2026-08-19T22:04:44.573189Z","submitted_at":"2025-06-09T10:00:54Z","title":"SceneRAG: Scene-level Retrieval-Augmented Generation for Video Understanding","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:51.006523Z"},"links":{"citing_paper":"/paper/2506.07600"},"observation_digest":"sha256:fc3f0e6036842a5dc0b7c4dad3c9a028a7ad3841ecc6ed4cfbf90eefa1694298","observation_id":"dcc53b3c-47fd-46e1-8b8d-b7856737744b","resolution":{"observed_at":"2026-08-07T05:35:51.578428Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:35:51.512376Z","title":"Is This the End of RAG? Anthropic’s NEW Prompt Caching","venue":null,"work_id":"9f338447-80b7-4a42-999e-a461bb088410","year":null},"citing_paper":{"arxiv_id":"2506.07600","last_updated":"2025-06-09T10:00:54Z","snapshot_observed_at":"2026-08-19T22:04:44.573189Z","submitted_at":"2025-06-09T10:00:54Z","title":"SceneRAG: Scene-level Retrieval-Augmented Generation for Video Understanding","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:51.010785Z"},"links":{"citing_paper":"/paper/2506.07600"},"observation_digest":"sha256:3aedb94d7b62331505dad8a6da43a9c215f18ddf8efb345699c187fcca73d21d","observation_id":"56d795ad-6a2c-412d-b5f2-5fdaba24c93f","resolution":{"observed_at":"2026-08-07T05:35:51.519683Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.07600","last_updated":"2025-06-09T10:00:54Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-19T22:04:44.573189Z","submitted_at":"2025-06-09T10:00:54Z","title":"SceneRAG: Scene-level Retrieval-Augmented Generation for Video Understanding"},"reference_resolution":{"displayed":58,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":35,"verified_exact":0,"verified_fuzzy":23},"total_outbound_references":58},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 58 of 58 outbound references and 2 inbound Pith citation observations for arXiv:2506.07600."}