{"as_of":"2026-08-09T20:59:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9892a0d8433868ba016a5d33194ce862eccfee02e44ec80486ce8fe9ce965742","coverage":[{"denominator":60,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":60,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T00:00:03.806881Z","state":"measured"},{"denominator":60,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":60,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2508.04546/citation-record","integrity":"/paper/2508.04546/integrity","json":"/paper/2508.04546/citation-record.json","paper":"/paper/2508.04546"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:00:04.373564Z","title":"A new surveil- lance and security alert system based on real-time motion de- tection.Journal of Smart Systems Research, 4:31–47, 2023","venue":null,"work_id":"79fe1cce-9e2a-4c6a-80f5-e3799bf625d9","year":2023},"citing_paper":{"arxiv_id":"2508.04546","last_updated":"2025-08-06T15:33:49Z","snapshot_observed_at":"2026-08-09T11:38:34.085151Z","submitted_at":"2025-08-06T15:33:49Z","title":"Hierarchical Event Memory for Accurate and Low-latency Online Video Temporal Grounding","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T00:00:03.626468Z"},"links":{"citing_paper":"/paper/2508.04546"},"observation_digest":"sha256:dbcd3e8f64b0841e6fadbb408a381378937e1820e536b1381197a0d8473eef00","observation_id":"c8c106e4-32ed-4feb-a878-f068044377f2","resolution":{"observed_at":"2026-08-06T00:00:04.376583Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:00:04.365316Z","title":"Miniroad: Minimal rnn framework for online action detection","venue":null,"work_id":"4378bde2-12a2-4bf1-91dd-c7d52b654681","year":2023},"citing_paper":{"arxiv_id":"2508.04546","last_updated":"2025-08-06T15:33:49Z","snapshot_observed_at":"2026-08-09T11:38:34.085151Z","submitted_at":"2025-08-06T15:33:49Z","title":"Hierarchical Event Memory for Accurate and Low-latency Online Video Temporal Grounding","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T00:00:03.630495Z"},"links":{"citing_paper":"/paper/2508.04546"},"observation_digest":"sha256:c6181367b19f21c773454578b33b64ee59cb166b12e745a50703aa34ca302ad7","observation_id":"37c3ec9e-6e40-4b02-8e1f-346f489af6e7","resolution":{"observed_at":"2026-08-06T00:00:04.368076Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:00:04.356197Z","title":"E2e-load: end-to-end long-form online action de- tection","venue":null,"work_id":"26bcca4a-b5fa-401d-b646-36b94d432caa","year":2023},"citing_paper":{"arxiv_id":"2508.04546","last_updated":"2025-08-06T15:33:49Z","snapshot_observed_at":"2026-08-09T11:38:34.085151Z","submitted_at":"2025-08-06T15:33:49Z","title":"Hierarchical Event Memory for Accurate and Low-latency Online Video Temporal Grounding","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T00:00:03.633772Z"},"links":{"citing_paper":"/paper/2508.04546"},"observation_digest":"sha256:7b3048227b07750dd464854eb23b98b9d7e8311b771e0bc0fc92d4b77bb9febd","observation_id":"4102aee0-96d1-4b0d-afb5-ce00ecd9c7a2","resolution":{"observed_at":"2026-08-06T00:00:04.359095Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:00:04.347560Z","title":"Gatehub: Gated history unit with background sup- pression for online action detection","venue":null,"work_id":"adbf716f-478d-41ac-b8ce-58e59f19a881","year":2022},"citing_paper":{"arxiv_id":"2508.04546","last_updated":"2025-08-06T15:33:49Z","snapshot_observed_at":"2026-08-09T11:38:34.085151Z","submitted_at":"2025-08-06T15:33:49Z","title":"Hierarchical Event Memory for Accurate and Low-latency Online Video Temporal Grounding","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T00:00:03.638144Z"},"links":{"citing_paper":"/paper/2508.04546"},"observation_digest":"sha256:cb41a550fcd19333a970d83598059dc1069f38cd081683d4c80df5fd2f3de693","observation_id":"68de790d-8497-4e7d-998c-dcd1201b4843","resolution":{"observed_at":"2026-08-06T00:00:04.350553Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06299","last_updated":"2024-09-10T07:53:10Z","snapshot_observed_at":"2026-08-09T11:39:49.555786Z","submitted_at":"2024-09-10T07:53:10Z","title":"Enhancing Long Video Understanding via Hierarchical Event-Based Memory","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.06299","snapshot_observed_at":"2026-08-06T00:00:03.642025Z","title":"Enhancing long video understanding via hierarchical event-based memory","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.04546","last_updated":"2025-08-06T15:33:49Z","snapshot_observed_at":"2026-08-09T11:38:34.085151Z","submitted_at":"2025-08-06T15:33:49Z","title":"Hierarchical Event Memory for Accurate and Low-latency Online Video Temporal Grounding","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T00:00:03.642025Z"},"links":{"cited_paper":"/paper/2409.06299","citing_paper":"/paper/2508.04546"},"observation_digest":"sha256:5c70738abb6238581a288e1c36000deabbdcea2825cce575091acb3edaf56657","observation_id":"c63d8f15-d39a-484b-a3b9-b56a872f5d50","resolution":{"observed_at":"2026-08-06T00:00:03.642025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.3555","last_updated":"2014-12-11T06:46:53Z","snapshot_observed_at":"2026-08-03T11:40:51.182181Z","submitted_at":"2014-12-11T06:46:53Z","title":"Empirical Evaluation of Gated Recurrent Neural Networks on Sequence Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.3555","snapshot_observed_at":"2026-08-06T00:00:03.645941Z","title":"Empirical evaluation of gated recurrent neural networks on sequence modeling.arXiv preprint arXiv:1412.3555, 2014","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2508.04546","last_updated":"2025-08-06T15:33:49Z","snapshot_observed_at":"2026-08-09T11:38:34.085151Z","submitted_at":"2025-08-06T15:33:49Z","title":"Hierarchical Event Memory for Accurate and Low-latency Online Video Temporal Grounding","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T00:00:03.645941Z"},"links":{"cited_paper":"/paper/1412.3555","citing_paper":"/paper/2508.04546"},"observation_digest":"sha256:ee0f9ae8c28e26eae663ed9e8205976163079d79fe7e080f9a683e0a8842f9ee","observation_id":"5766dccb-66ec-4831-9344-7f1a5f42bcf4","resolution":{"observed_at":"2026-08-06T00:00:03.645941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:00:04.338004Z","title":"Moment detection in long tutorial videos","venue":null,"work_id":"22138335-2b57-448e-8ebe-ce9ef7cb81a4","year":2023},"citing_paper":{"arxiv_id":"2508.04546","last_updated":"2025-08-06T15:33:49Z","snapshot_observed_at":"2026-08-09T11:38:34.085151Z","submitted_at":"2025-08-06T15:33:49Z","title":"Hierarchical Event Memory for Accurate and Low-latency Online Video Temporal Grounding","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T00:00:03.650510Z"},"links":{"citing_paper":"/paper/2508.04546"},"observation_digest":"sha256:4d5b44554b1b6a3c359997b4869eda03be8a26b3573d0940bd4af92dfea46f00","observation_id":"f4b83441-b569-49c3-9940-ef9418adec9c","resolution":{"observed_at":"2026-08-06T00:00:04.341043Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:00:04.328037Z","title":"Online ac- tion detection","venue":null,"work_id":"f77f20aa-5019-4e99-bf9a-135f6b845ce7","year":2016},"citing_paper":{"arxiv_id":"2508.04546","last_updated":"2025-08-06T15:33:49Z","snapshot_observed_at":"2026-08-09T11:38:34.085151Z","submitted_at":"2025-08-06T15:33:49Z","title":"Hierarchical Event Memory for Accurate and Low-latency Online Video Temporal Grounding","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T00:00:03.653383Z"},"links":{"citing_paper":"/paper/2508.04546"},"observation_digest":"sha256:ccd9147969f8f69eceb1bd496097078637179f594ea99802e08a010407c66aa2","observation_id":"4d64475c-9df3-4c21-8876-73943611cce8","resolution":{"observed_at":"2026-08-06T00:00:04.330770Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:00:04.319119Z","title":"Learning to discriminate information for online action detection","venue":null,"work_id":"a0acb18c-b845-4133-b67b-0a243dda5d4f","year":2020},"citing_paper":{"arxiv_id":"2508.04546","last_updated":"2025-08-06T15:33:49Z","snapshot_observed_at":"2026-08-09T11:38:34.085151Z","submitted_at":"2025-08-06T15:33:49Z","title":"Hierarchical Event Memory for Accurate and Low-latency Online Video Temporal Grounding","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T00:00:03.656452Z"},"links":{"citing_paper":"/paper/2508.04546"},"observation_digest":"sha256:b333e79f8084c42a03b00d7fa33bdcc11f118c63299d0806ac7a09fe4ad57e3b","observation_id":"e3a56d9d-92f6-423a-82f3-9463e0ace12b","resolution":{"observed_at":"2026-08-06T00:00:04.322006Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:00:04.310208Z","title":"Temporal sentence grounding in streaming videos","venue":null,"work_id":"9becd40c-42cd-4750-9e08-e1932c6318ab","year":2023},"citing_paper":{"arxiv_id":"2508.04546","last_updated":"2025-08-06T15:33:49Z","snapshot_observed_at":"2026-08-09T11:38:34.085151Z","submitted_at":"2025-08-06T15:33:49Z","title":"Hierarchical Event Memory for Accurate and Low-latency Online Video Temporal Grounding","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T00:00:03.659145Z"},"links":{"citing_paper":"/paper/2508.04546"},"observation_digest":"sha256:ac384801fba08d585521d936e36853481455c8d4e810d722394c871d04f7f445","observation_id":"9ae8c4fb-bdc2-4f11-bae0-81e5fe594f52","resolution":{"observed_at":"2026-08-06T00:00:04.313071Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:00:04.301007Z","title":"Tall: Temporal activity localization via language query","venue":null,"work_id":"ccf31010-e0f6-4ed6-ae94-4de134a569bf","year":2017},"citing_paper":{"arxiv_id":"2508.04546","last_updated":"2025-08-06T15:33:49Z","snapshot_observed_at":"2026-08-09T11:38:34.085151Z","submitted_at":"2025-08-06T15:33:49Z","title":"Hierarchical Event Memory for Accurate and Low-latency Online Video Temporal Grounding","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T00:00:03.661894Z"},"links":{"citing_paper":"/paper/2508.04546"},"observation_digest":"sha256:8974e02e41d9ef4236ac3b3fcdaa3eb0a23e15f5d57fec0a96e06e882115822b","observation_id":"1bc21709-7208-4148-878d-b399b0cc003b","resolution":{"observed_at":"2026-08-06T00:00:04.303986Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:00:04.291348Z","title":"Prentice Hall PTR, 1994","venue":null,"work_id":"3d32dbe3-7278-48cf-8b6a-22eaa4cd8791","year":1994},"citing_paper":{"arxiv_id":"2508.04546","last_updated":"2025-08-06T15:33:49Z","snapshot_observed_at":"2026-08-09T11:38:34.085151Z","submitted_at":"2025-08-06T15:33:49Z","title":"Hierarchical Event Memory for Accurate and Low-latency Online Video Temporal Grounding","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T00:00:03.665577Z"},"links":{"citing_paper":"/paper/2508.04546"},"observation_digest":"sha256:44b384ce4684af8405a108bb318dcedba4e4409131af0143c152e12f56f0d102","observation_id":"ddbaed9e-9cbd-46e4-b495-5ca378a84ecd","resolution":{"observed_at":"2026-08-06T00:00:04.294359Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:00:04.280877Z","title":"Ma-lmm: Memory-augmented large multimodal model for long-term video understanding","venue":null,"work_id":"9aa253fd-2e90-4dc0-a827-ce08fc513311","year":2024},"citing_paper":{"arxiv_id":"2508.04546","last_updated":"2025-08-06T15:33:49Z","snapshot_observed_at":"2026-08-09T11:38:34.085151Z","submitted_at":"2025-08-06T15:33:49Z","title":"Hierarchical Event Memory for Accurate and Low-latency Online Video Temporal Grounding","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T00:00:03.668777Z"},"links":{"citing_paper":"/paper/2508.04546"},"observation_digest":"sha256:458299ad0767b145e7d99f6a5950024b9af0c586b508eb3facaef836d0db1050","observation_id":"22d561b4-8f13-4005-81e5-f64b2b7b4880","resolution":{"observed_at":"2026-08-06T00:00:04.284042Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:00:04.270115Z","title":"Video activity localisation with uncertainties in temporal boundary","venue":null,"work_id":"3c7e9955-aa77-40ed-b8e9-f4fdcca3312f","year":2022},"citing_paper":{"arxiv_id":"2508.04546","last_updated":"2025-08-06T15:33:49Z","snapshot_observed_at":"2026-08-09T11:38:34.085151Z","submitted_at":"2025-08-06T15:33:49Z","title":"Hierarchical Event Memory for Accurate and Low-latency Online Video Temporal Grounding","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T00:00:03.671586Z"},"links":{"citing_paper":"/paper/2508.04546"},"observation_digest":"sha256:718bb999161b9d6f410a78f3c42641fbcbdcffb7dccbfd966550986495d3ca32","observation_id":"7701116d-ee02-4b81-99de-e9b508b57309","resolution":{"observed_at":"2026-08-06T00:00:04.273144Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:00:04.260173Z","title":"Cag-qil: Context-aware actionness grouping via q im- itation learning for online temporal action localization","venue":null,"work_id":"6993e842-28a9-4376-8895-9dac9f687d9b","year":2021},"citing_paper":{"arxiv_id":"2508.04546","last_updated":"2025-08-06T15:33:49Z","snapshot_observed_at":"2026-08-09T11:38:34.085151Z","submitted_at":"2025-08-06T15:33:49Z","title":"Hierarchical Event Memory for Accurate and Low-latency Online Video Temporal Grounding","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T00:00:03.674278Z"},"links":{"citing_paper":"/paper/2508.04546"},"observation_digest":"sha256:86a0d1e58f7092f0d3e1dcf9e89ae035d61aadc7039d284afd1994e0a782a9c2","observation_id":"96fe039f-1857-4ac6-aba6-d6b8fe041f4f","resolution":{"observed_at":"2026-08-06T00:00:04.263894Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:00:04.250037Z","title":"A sliding window scheme for online temporal action localization","venue":null,"work_id":"9f7c9cb0-6213-4d05-b15f-47c8afb9610b","year":2022},"citing_paper":{"arxiv_id":"2508.04546","last_updated":"2025-08-06T15:33:49Z","snapshot_observed_at":"2026-08-09T11:38:34.085151Z","submitted_at":"2025-08-06T15:33:49Z","title":"Hierarchical Event Memory for Accurate and Low-latency Online Video Temporal Grounding","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T00:00:03.677553Z"},"links":{"citing_paper":"/paper/2508.04546"},"observation_digest":"sha256:5f5fc6432e2d0ff6de24120e2663671400da420540d2c0f3b95435fb5e565fa2","observation_id":"b347f31d-2c9f-4030-81bd-a2a602ebd70a","resolution":{"observed_at":"2026-08-06T00:00:04.252811Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:00:04.240889Z","title":"Dense-captioning events in videos","venue":null,"work_id":"e59393b4-8b8f-45df-8842-dd130bddf6f9","year":2017},"citing_paper":{"arxiv_id":"2508.04546","last_updated":"2025-08-06T15:33:49Z","snapshot_observed_at":"2026-08-09T11:38:34.085151Z","submitted_at":"2025-08-06T15:33:49Z","title":"Hierarchical Event Memory for Accurate and Low-latency Online Video Temporal Grounding","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T00:00:03.681058Z"},"links":{"citing_paper":"/paper/2508.04546"},"observation_digest":"sha256:033e95fb52bb3f3f3f8f8f4637af62de50e319126bbe8e57a3d63cc51477d977","observation_id":"a38911d8-ad59-4ccc-9e24-2b367f69981d","resolution":{"observed_at":"2026-08-06T00:00:04.243918Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:00:03.684597Z","title":"Efficient adaptive human-object inter- action detection with concept-guided memory, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.04546","last_updated":"2025-08-06T15:33:49Z","snapshot_observed_at":"2026-08-09T11:38:34.085151Z","submitted_at":"2025-08-06T15:33:49Z","title":"Hierarchical Event Memory for Accurate and Low-latency Online Video Temporal Grounding","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T00:00:03.684597Z"},"links":{"citing_paper":"/paper/2508.04546"},"observation_digest":"sha256:b4778f56a5451343a2a740571e1c729c45c3a992fa02848e3eafd3afb09d61e8","observation_id":"61f5090b-c327-43a5-bd3e-bdccb56cdc8c","resolution":{"observed_at":"2026-08-06T00:00:03.684597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:00:04.224951Z","title":"Cross modal adaptive few-shot learning based on task depen- dence.Chinese Journal of Electronics, 32(1):85–96, 2023","venue":null,"work_id":"3b056e49-70b1-41d4-9622-e6ad3e7008f2","year":2023},"citing_paper":{"arxiv_id":"2508.04546","last_updated":"2025-08-06T15:33:49Z","snapshot_observed_at":"2026-08-09T11:38:34.085151Z","submitted_at":"2025-08-06T15:33:49Z","title":"Hierarchical Event Memory for Accurate and Low-latency Online Video Temporal Grounding","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T00:00:03.688413Z"},"links":{"citing_paper":"/paper/2508.04546"},"observation_digest":"sha256:7a24b3bb87747b007a7e9a7126620ccbb84c047c9cbe41e3ac88e74194ecd9e4","observation_id":"e705e4b5-20a3-4d7d-9d95-b2cb8646400c","resolution":{"observed_at":"2026-08-06T00:00:04.228389Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:00:04.214767Z","title":"G2l: Semantically aligned and uniform video grounding via geodesic and game theory","venue":null,"work_id":"539b8a2b-691e-47d7-823a-c0b41d79eb49","year":2023},"citing_paper":{"arxiv_id":"2508.04546","last_updated":"2025-08-06T15:33:49Z","snapshot_observed_at":"2026-08-09T11:38:34.085151Z","submitted_at":"2025-08-06T15:33:49Z","title":"Hierarchical Event Memory for Accurate and Low-latency Online Video Temporal Grounding","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T00:00:03.691376Z"},"links":{"citing_paper":"/paper/2508.04546"},"observation_digest":"sha256:b0bb6efe7c40284a1a1ab365c10aa0937eb478296b5fe10df5b4c30204e34ac4","observation_id":"416f8863-437c-4ce6-ab09-062868f6a599","resolution":{"observed_at":"2026-08-06T00:00:04.218186Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:00:04.205576Z","title":"Mo- mentdiff: Generative video moment retrieval from random to real.Advances in neural information processing systems, 36, 2024","venue":null,"work_id":"191012cb-c13a-4f89-856d-ea75b66c36d3","year":2024},"citing_paper":{"arxiv_id":"2508.04546","last_updated":"2025-08-06T15:33:49Z","snapshot_observed_at":"2026-08-09T11:38:34.085151Z","submitted_at":"2025-08-06T15:33:49Z","title":"Hierarchical Event Memory for Accurate and Low-latency Online Video Temporal Grounding","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T00:00:03.694304Z"},"links":{"citing_paper":"/paper/2508.04546"},"observation_digest":"sha256:d64021d46f82100a5dc0d7ce4524b477d23d80bfe76f6de9d86a2595d2e0c630","observation_id":"92a0772e-0c2a-4ed5-8f40-ed514094ea8d","resolution":{"observed_at":"2026-08-06T00:00:04.208553Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1708.02002","last_updated":"2018-02-07T18:44:44Z","snapshot_observed_at":"2026-07-06T05:54:18.908943Z","submitted_at":"2017-08-07T06:32:42Z","title":"Focal Loss for Dense Object Detection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1708.02002","snapshot_observed_at":"2026-08-06T00:00:03.698296Z","title":"Focal loss for dense object detection.arXiv preprint arXiv:1708.02002, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2508.04546","last_updated":"2025-08-06T15:33:49Z","snapshot_observed_at":"2026-08-09T11:38:34.085151Z","submitted_at":"2025-08-06T15:33:49Z","title":"Hierarchical Event Memory for Accurate and Low-latency Online Video Temporal Grounding","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T00:00:03.698296Z"},"links":{"cited_paper":"/paper/1708.02002","citing_paper":"/paper/2508.04546"},"observation_digest":"sha256:b2b6d41ec204b4687fc60d4298e83138aca0dee2e7bc317bf2abf30c6d52f231","observation_id":"ea08fb25-3a90-4b9d-a5e6-d6e13bc7ceb8","resolution":{"observed_at":"2026-08-06T00:00:03.698296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:00:04.195220Z","title":"Towards balanced alignment: Modal-enhanced semantic modeling for video moment re- trieval","venue":null,"work_id":"8239c260-0386-4973-abad-1a6b230c3988","year":2024},"citing_paper":{"arxiv_id":"2508.04546","last_updated":"2025-08-06T15:33:49Z","snapshot_observed_at":"2026-08-09T11:38:34.085151Z","submitted_at":"2025-08-06T15:33:49Z","title":"Hierarchical Event Memory for Accurate and Low-latency Online Video Temporal Grounding","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T00:00:03.701578Z"},"links":{"citing_paper":"/paper/2508.04546"},"observation_digest":"sha256:d9f3a12f640f86c23368dcd7341771371c79839dc8ef3b1b92b9b74e3008a6b9","observation_id":"90fbad3b-e4c0-40fc-897e-d323c11b0485","resolution":{"observed_at":"2026-08-06T00:00:04.198675Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-09T20:34:52.923500Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-06T00:00:03.704250Z","title":"Decoupled weight decay regularization.arXiv preprint arXiv:1711.05101, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2508.04546","last_updated":"2025-08-06T15:33:49Z","snapshot_observed_at":"2026-08-09T11:38:34.085151Z","submitted_at":"2025-08-06T15:33:49Z","title":"Hierarchical Event Memory for Accurate and Low-latency Online Video Temporal Grounding","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T00:00:03.704250Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2508.04546"},"observation_digest":"sha256:a8b5d2a0b3bcb4dc9fb99da63386bf88b18e694c4d84c24fb3971fc0668c68d0","observation_id":"586018d7-d057-490a-9fb5-f9c59ebb7acd","resolution":{"observed_at":"2026-08-06T00:00:03.704250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:00:04.184619Z","title":"Towards generalisable video moment retrieval: Visual-dynamic injection to image-text pre-training","venue":null,"work_id":"815ad3ca-82ea-4922-b298-844dd3bcc407","year":2023},"citing_paper":{"arxiv_id":"2508.04546","last_updated":"2025-08-06T15:33:49Z","snapshot_observed_at":"2026-08-09T11:38:34.085151Z","submitted_at":"2025-08-06T15:33:49Z","title":"Hierarchical Event Memory for Accurate and Low-latency Online Video Temporal Grounding","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T00:00:03.707413Z"},"links":{"citing_paper":"/paper/2508.04546"},"observation_digest":"sha256:de5f64163a97e048f561d6129efae9e820ca0e5df568756b3d2309f5f065a636","observation_id":"bbc6bdd9-1d23-428d-83a0-cc781903a67b","resolution":{"observed_at":"2026-08-06T00:00:04.187780Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:00:04.174223Z","title":"Zero-shot video moment retrieval from frozen vision-language models","venue":null,"work_id":"166203db-f99d-4419-aa7a-6352155348b1","year":2024},"citing_paper":{"arxiv_id":"2508.04546","last_updated":"2025-08-06T15:33:49Z","snapshot_observed_at":"2026-08-09T11:38:34.085151Z","submitted_at":"2025-08-06T15:33:49Z","title":"Hierarchical Event Memory for Accurate and Low-latency Online Video Temporal Grounding","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T00:00:03.709898Z"},"links":{"citing_paper":"/paper/2508.04546"},"observation_digest":"sha256:f418164fd0207751e2a70313e440d470be81e5a3d679d0bd10e7887f7d3b51f7","observation_id":"682839cf-a0e6-4a5e-bb05-b3cf8e05db07","resolution":{"observed_at":"2026-08-06T00:00:04.178388Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:00:04.163747Z","title":"Snag: Scalable and accurate video grounding","venue":null,"work_id":"4ee46f42-98cd-4688-8631-917988a60ef0","year":2024},"citing_paper":{"arxiv_id":"2508.04546","last_updated":"2025-08-06T15:33:49Z","snapshot_observed_at":"2026-08-09T11:38:34.085151Z","submitted_at":"2025-08-06T15:33:49Z","title":"Hierarchical Event Memory for Accurate and Low-latency Online Video Temporal Grounding","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T00:00:03.712473Z"},"links":{"citing_paper":"/paper/2508.04546"},"observation_digest":"sha256:99e9b5fd278184da0f664dad60a2f7c94c8acfcca36f7b5d9074154da2f32d5f","observation_id":"1c511538-94b7-4b1d-be38-a696d8d0e853","resolution":{"observed_at":"2026-08-06T00:00:04.167028Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:00:04.154215Z","title":"Local- global video-text interactions for temporal grounding","venue":null,"work_id":"80bfb475-3db4-4357-8407-deec2387e3a9","year":2020},"citing_paper":{"arxiv_id":"2508.04546","last_updated":"2025-08-06T15:33:49Z","snapshot_observed_at":"2026-08-09T11:38:34.085151Z","submitted_at":"2025-08-06T15:33:49Z","title":"Hierarchical Event Memory for Accurate and Low-latency Online Video Temporal Grounding","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T00:00:03.715246Z"},"links":{"citing_paper":"/paper/2508.04546"},"observation_digest":"sha256:da3046d732979660d0882bbda750ebf0343430ff5485a981f0b0811f08490c2a","observation_id":"29c00aae-dbda-4bac-8ab3-666817837939","resolution":{"observed_at":"2026-08-06T00:00:04.157203Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08345","last_updated":"2023-03-22T12:41:03Z","snapshot_observed_at":"2026-07-06T15:03:30.911601Z","submitted_at":"2023-03-15T03:54:43Z","title":"Scanning Only Once: An End-to-end Framework for Fast Temporal Grounding in Long Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08345","snapshot_observed_at":"2026-08-06T00:00:03.717769Z","title":"Scanning only once: An end-to-end framework for fast temporal grounding in long videos.arXiv preprint arXiv:2303.08345, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.04546","last_updated":"2025-08-06T15:33:49Z","snapshot_observed_at":"2026-08-09T11:38:34.085151Z","submitted_at":"2025-08-06T15:33:49Z","title":"Hierarchical Event Memory for Accurate and Low-latency Online Video Temporal Grounding","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T00:00:03.717769Z"},"links":{"cited_paper":"/paper/2303.08345","citing_paper":"/paper/2508.04546"},"observation_digest":"sha256:ab0f4cb5da6b297e52752c6314b7a61287c1625585f3f611c3d5075d7881b8eb","observation_id":"62a2d395-520d-4e59-bda1-26624444bab3","resolution":{"observed_at":"2026-08-06T00:00:03.717769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:00:04.144325Z","title":"An overview of cross-media retrieval: Concepts, methodologies, bench- marks, and challenges.IEEE Transactions on Circuits and Systems for Video Technology, 28:2372–2385, 2017","venue":null,"work_id":"df3f3635-21a6-4a48-ad34-20e9585a1477","year":2017},"citing_paper":{"arxiv_id":"2508.04546","last_updated":"2025-08-06T15:33:49Z","snapshot_observed_at":"2026-08-09T11:38:34.085151Z","submitted_at":"2025-08-06T15:33:49Z","title":"Hierarchical Event Memory for Accurate and Low-latency Online Video Temporal Grounding","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T00:00:03.720559Z"},"links":{"citing_paper":"/paper/2508.04546"},"observation_digest":"sha256:3f03f0683332c61aa224b4ad81c332b9e819e642690c41cbf02c9d37c28b930c","observation_id":"55159b80-fd16-46c9-923d-d042b8b564fe","resolution":{"observed_at":"2026-08-06T00:00:04.147813Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:00:03.723182Z","title":"Streaming long video understanding with large language models.Advances in Neu- ral Information Processing Systems, 37:119336–119360,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.04546","last_updated":"2025-08-06T15:33:49Z","snapshot_observed_at":"2026-08-09T11:38:34.085151Z","submitted_at":"2025-08-06T15:33:49Z","title":"Hierarchical Event Memory for Accurate and Low-latency Online Video Temporal Grounding","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T00:00:03.723182Z"},"links":{"citing_paper":"/paper/2508.04546"},"observation_digest":"sha256:3640001fdc02aa76df33787b498380709b015e6fd90d3a4c571c6b0185da400b","observation_id":"ecc23ea0-ba85-4e35-965a-b952cf0ef620","resolution":{"observed_at":"2026-08-06T00:00:03.723182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:00:03.726376Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.04546","last_updated":"2025-08-06T15:33:49Z","snapshot_observed_at":"2026-08-09T11:38:34.085151Z","submitted_at":"2025-08-06T15:33:49Z","title":"Hierarchical Event Memory for Accurate and Low-latency Online Video Temporal Grounding","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T00:00:03.726376Z"},"links":{"citing_paper":"/paper/2508.04546"},"observation_digest":"sha256:b45a91174fb65297a3bc76e014bfa45545699daae2dc9d94965cffeb28982dc8","observation_id":"de278ce3-8708-465c-b82b-22be9f626f49","resolution":{"observed_at":"2026-08-06T00:00:03.726376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:00:04.123034Z","title":"Hat: History-augmented anchor transformer for on- line temporal action localization","venue":null,"work_id":"1dd557da-e07a-4765-b16a-2a3c8d59365b","year":2025},"citing_paper":{"arxiv_id":"2508.04546","last_updated":"2025-08-06T15:33:49Z","snapshot_observed_at":"2026-08-09T11:38:34.085151Z","submitted_at":"2025-08-06T15:33:49Z","title":"Hierarchical Event Memory for Accurate and Low-latency Online Video Temporal Grounding","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T00:00:03.729869Z"},"links":{"citing_paper":"/paper/2508.04546"},"observation_digest":"sha256:a46835767ea01a6897a04d6424657df9dbf7de6e8497d5e1b67a6c6d31aa33e8","observation_id":"ed936847-2d8d-4196-afb2-639f8251bbd4","resolution":{"observed_at":"2026-08-06T00:00:04.126061Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:00:04.113087Z","title":"Coherent multi-sentence video description with variable level of detail","venue":null,"work_id":"e6580c35-8ad9-4cc9-bfef-d640f107aa5d","year":2014},"citing_paper":{"arxiv_id":"2508.04546","last_updated":"2025-08-06T15:33:49Z","snapshot_observed_at":"2026-08-09T11:38:34.085151Z","submitted_at":"2025-08-06T15:33:49Z","title":"Hierarchical Event Memory for Accurate and Low-latency Online Video Temporal Grounding","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T00:00:03.732731Z"},"links":{"citing_paper":"/paper/2508.04546"},"observation_digest":"sha256:742fd58ad7b5f4abdf6c15b313187b396bce3d8d70b2d3299cdc13f23f6b837b","observation_id":"77504ab3-10f2-404f-9263-8aeda83c81e6","resolution":{"observed_at":"2026-08-06T00:00:04.116314Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:00:04.103696Z","title":"Online action detection in untrimmed, streaming videos-modeling and evaluation","venue":null,"work_id":"dd61b289-edb1-4243-a025-e87cbea4c1bf","year":2018},"citing_paper":{"arxiv_id":"2508.04546","last_updated":"2025-08-06T15:33:49Z","snapshot_observed_at":"2026-08-09T11:38:34.085151Z","submitted_at":"2025-08-06T15:33:49Z","title":"Hierarchical Event Memory for Accurate and Low-latency Online Video Temporal Grounding","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T00:00:03.735226Z"},"links":{"citing_paper":"/paper/2508.04546"},"observation_digest":"sha256:4d58ebd3bd3bd86c2327a1e21778c88ef3ee53eedb58d86b70d1a1a951594d49","observation_id":"d59f1833-1610-415e-a2cd-397bb2018bc6","resolution":{"observed_at":"2026-08-06T00:00:04.106866Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:00:04.094452Z","title":"Mad: A scalable dataset for language grounding in videos from movie audio descriptions","venue":null,"work_id":"4285c203-ca5c-42f9-88d5-ba761f44c2e4","year":2022},"citing_paper":{"arxiv_id":"2508.04546","last_updated":"2025-08-06T15:33:49Z","snapshot_observed_at":"2026-08-09T11:38:34.085151Z","submitted_at":"2025-08-06T15:33:49Z","title":"Hierarchical Event Memory for Accurate and Low-latency Online Video Temporal Grounding","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T00:00:03.737976Z"},"links":{"citing_paper":"/paper/2508.04546"},"observation_digest":"sha256:204c00a016c6d5354955aabf44e06763a64de2cb2262f6cd520fa6a519bfbeef","observation_id":"567aa239-1c2b-4965-bc43-e1b8b8bde4f6","resolution":{"observed_at":"2026-08-06T00:00:04.097528Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:00:04.084019Z","title":"Moviechat: From dense token to sparse memory for long video understanding","venue":null,"work_id":"d196538c-1779-4dce-bb01-f0abed876bb4","year":2024},"citing_paper":{"arxiv_id":"2508.04546","last_updated":"2025-08-06T15:33:49Z","snapshot_observed_at":"2026-08-09T11:38:34.085151Z","submitted_at":"2025-08-06T15:33:49Z","title":"Hierarchical Event Memory for Accurate and Low-latency Online Video Temporal Grounding","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T00:00:03.740748Z"},"links":{"citing_paper":"/paper/2508.04546"},"observation_digest":"sha256:ac1d25ce98592a334211852e7bbd41b6ebf5bd2cb259545d9de4c47f67e5f4dd","observation_id":"59b7e413-3c40-45c9-9f79-845b88d3bf28","resolution":{"observed_at":"2026-08-06T00:00:04.087010Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:00:03.743312Z","title":"Learning spatiotemporal features with 3d convolutional networks","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.04546","last_updated":"2025-08-06T15:33:49Z","snapshot_observed_at":"2026-08-09T11:38:34.085151Z","submitted_at":"2025-08-06T15:33:49Z","title":"Hierarchical Event Memory for Accurate and Low-latency Online Video Temporal Grounding","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T00:00:03.743312Z"},"links":{"citing_paper":"/paper/2508.04546"},"observation_digest":"sha256:2d9ef45f7cd64ed93dc75c63a525f8bfa46c07131987b9bfc4878d523c10948f","observation_id":"e1182f0a-4318-4e2e-ad82-76ff4e3e519e","resolution":{"observed_at":"2026-08-06T00:00:03.743312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:00:04.068853Z","title":"Attention is all you need.Advances in neural information processing systems, 30, 2017","venue":null,"work_id":"d79df3c9-d26c-496d-bea8-669f0401b9b4","year":2017},"citing_paper":{"arxiv_id":"2508.04546","last_updated":"2025-08-06T15:33:49Z","snapshot_observed_at":"2026-08-09T11:38:34.085151Z","submitted_at":"2025-08-06T15:33:49Z","title":"Hierarchical Event Memory for Accurate and Low-latency Online Video Temporal Grounding","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T00:00:03.746238Z"},"links":{"citing_paper":"/paper/2508.04546"},"observation_digest":"sha256:2b660f05a0a453b54e730ad556efc98a86842faede446ba74a507dc803e56924","observation_id":"a033cea5-7d45-4ca8-b740-712720ff790e","resolution":{"observed_at":"2026-08-06T00:00:04.072095Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:00:04.059800Z","title":"Oadtr: Online action detection with transformers","venue":null,"work_id":"2ece80da-2ea2-4bc3-8f79-2ade45aedb17","year":2021},"citing_paper":{"arxiv_id":"2508.04546","last_updated":"2025-08-06T15:33:49Z","snapshot_observed_at":"2026-08-09T11:38:34.085151Z","submitted_at":"2025-08-06T15:33:49Z","title":"Hierarchical Event Memory for Accurate and Low-latency Online Video Temporal Grounding","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T00:00:03.748889Z"},"links":{"citing_paper":"/paper/2508.04546"},"observation_digest":"sha256:4b284abecf382a2d82b6dbc5ef38539023530fc7f4616d94fd9367868948ee5e","observation_id":"0e9005ce-0fdf-4021-94d6-b52be4d1e664","resolution":{"observed_at":"2026-08-06T00:00:04.062710Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:00:04.050298Z","title":"Efficient temporal extrapolation of multimodal large language models with temporal grounding bridge","venue":null,"work_id":"46788cc5-b833-4616-87a2-a6fc3ea2e799","year":null},"citing_paper":{"arxiv_id":"2508.04546","last_updated":"2025-08-06T15:33:49Z","snapshot_observed_at":"2026-08-09T11:38:34.085151Z","submitted_at":"2025-08-06T15:33:49Z","title":"Hierarchical Event Memory for Accurate and Low-latency Online Video Temporal Grounding","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T00:00:03.751591Z"},"links":{"citing_paper":"/paper/2508.04546"},"observation_digest":"sha256:722bd64093e962d09b9808c195c54815f9d19d3cc327bf0517d22449d9ce2d6e","observation_id":"6e01456c-dabb-4883-965f-2ae7c1926e44","resolution":{"observed_at":"2026-08-06T00:00:04.053554Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.01071","last_updated":"2025-08-02T13:32:09Z","snapshot_observed_at":"2026-07-06T19:09:10.244642Z","submitted_at":"2024-09-02T08:52:58Z","title":"VideoLLaMB: Long Streaming Video Understanding with Recurrent Memory Bridges","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.01071","snapshot_observed_at":"2026-08-06T00:00:03.754369Z","title":"Videollamb: Long-context video understanding with recur- rent memory bridges.arXiv preprint arXiv:2409.01071,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.04546","last_updated":"2025-08-06T15:33:49Z","snapshot_observed_at":"2026-08-09T11:38:34.085151Z","submitted_at":"2025-08-06T15:33:49Z","title":"Hierarchical Event Memory for Accurate and Low-latency Online Video Temporal Grounding","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T00:00:03.754369Z"},"links":{"cited_paper":"/paper/2409.01071","citing_paper":"/paper/2508.04546"},"observation_digest":"sha256:4073ea9b4669b43bf1e2187cfe1a6fb9f13a15a953038f246638f544c49b6ae8","observation_id":"6c2b59d2-197a-469b-83ea-a207d082543a","resolution":{"observed_at":"2026-08-06T00:00:03.754369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:00:04.040831Z","title":"Negative sample matters: A renaissance of met- ric learning for temporal grounding","venue":null,"work_id":"489d31d8-d464-43ea-a5f0-7e6cf6fb6528","year":2022},"citing_paper":{"arxiv_id":"2508.04546","last_updated":"2025-08-06T15:33:49Z","snapshot_observed_at":"2026-08-09T11:38:34.085151Z","submitted_at":"2025-08-06T15:33:49Z","title":"Hierarchical Event Memory for Accurate and Low-latency Online Video Temporal Grounding","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T00:00:03.757493Z"},"links":{"citing_paper":"/paper/2508.04546"},"observation_digest":"sha256:b3fb06103b733325944ef6a3e20eb2abe62e9aa30836dccd297272d9fb394fe8","observation_id":"781b5f8a-ddd4-4500-9748-5d442a38d4f9","resolution":{"observed_at":"2026-08-06T00:00:04.044174Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:00:03.760159Z","title":"Longvlm: Efficient long video understand- ing via large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.04546","last_updated":"2025-08-06T15:33:49Z","snapshot_observed_at":"2026-08-09T11:38:34.085151Z","submitted_at":"2025-08-06T15:33:49Z","title":"Hierarchical Event Memory for Accurate and Low-latency Online Video Temporal Grounding","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T00:00:03.760159Z"},"links":{"citing_paper":"/paper/2508.04546"},"observation_digest":"sha256:8fecdac993db4a848c0e319ee6ccd59abb7a47b2f4ea35ecf0b846bddb100f18","observation_id":"3537a7a4-eb0e-4060-908c-938ad3258cb0","resolution":{"observed_at":"2026-08-06T00:00:03.760159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:00:04.023052Z","title":"Bridging the gap: A unified video comprehension framework for mo- ment retrieval and highlight detection","venue":null,"work_id":"92a371f3-bf09-4b59-bbc8-a6c61db44136","year":2024},"citing_paper":{"arxiv_id":"2508.04546","last_updated":"2025-08-06T15:33:49Z","snapshot_observed_at":"2026-08-09T11:38:34.085151Z","submitted_at":"2025-08-06T15:33:49Z","title":"Hierarchical Event Memory for Accurate and Low-latency Online Video Temporal Grounding","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T00:00:03.762870Z"},"links":{"citing_paper":"/paper/2508.04546"},"observation_digest":"sha256:f024328a4dad8497ee87be43c2e2a3295d8ab68396b2201cf225b292c8533cbf","observation_id":"70e4c475-a2c6-4257-af6c-805eba6e4563","resolution":{"observed_at":"2026-08-06T00:00:04.026870Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:00:03.765400Z","title":"Temporal recurrent networks for online action detection","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.04546","last_updated":"2025-08-06T15:33:49Z","snapshot_observed_at":"2026-08-09T11:38:34.085151Z","submitted_at":"2025-08-06T15:33:49Z","title":"Hierarchical Event Memory for Accurate and Low-latency Online Video Temporal Grounding","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T00:00:03.765400Z"},"links":{"citing_paper":"/paper/2508.04546"},"observation_digest":"sha256:d1e6c81046e34f79368ed476b4e6a160343acb2c4580892acbeafa359fd0b76c","observation_id":"221385eb-fec1-4fb8-a76c-18145febdba6","resolution":{"observed_at":"2026-08-06T00:00:03.765400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:00:04.008042Z","title":"Long short-term trans- former for online action detection.Advances in Neural In- formation Processing Systems, 34:1086–1099, 2021","venue":null,"work_id":"3bba6798-f9ba-4f25-8d25-1d7c108e4e16","year":2021},"citing_paper":{"arxiv_id":"2508.04546","last_updated":"2025-08-06T15:33:49Z","snapshot_observed_at":"2026-08-09T11:38:34.085151Z","submitted_at":"2025-08-06T15:33:49Z","title":"Hierarchical Event Memory for Accurate and Low-latency Online Video Temporal Grounding","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T00:00:03.768204Z"},"links":{"citing_paper":"/paper/2508.04546"},"observation_digest":"sha256:93d253a016957d2da51059889ef6117d1c80a3aec1fe26d98addc5b52c6ba4f1","observation_id":"4d79a847-4f31-4660-a963-303c645526f9","resolution":{"observed_at":"2026-08-06T00:00:04.011062Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:00:03.998060Z","title":"Active object detection with knowledge aggregation and distillation from large models","venue":null,"work_id":"a618d640-cd04-493b-81a0-b3a207bf0920","year":2024},"citing_paper":{"arxiv_id":"2508.04546","last_updated":"2025-08-06T15:33:49Z","snapshot_observed_at":"2026-08-09T11:38:34.085151Z","submitted_at":"2025-08-06T15:33:49Z","title":"Hierarchical Event Memory for Accurate and Low-latency Online Video Temporal Grounding","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T00:00:03.770695Z"},"links":{"citing_paper":"/paper/2508.04546"},"observation_digest":"sha256:5bdb9bea229b3e98644af5c41b986b1e214d50675fda2fdded8b944b7ec5b9cc","observation_id":"746f2438-8cdd-40bd-8e19-b901c06f55d0","resolution":{"observed_at":"2026-08-06T00:00:04.001334Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:00:03.988976Z","title":"Flowgananomaly: Flow-based anomaly network intrusion detection with adver- sarial learning.Chinese Journal of Electronics, 33(1):58–71,","venue":null,"work_id":"5d9835c0-871d-43e4-9c72-39b3c3f6c9de","year":null},"citing_paper":{"arxiv_id":"2508.04546","last_updated":"2025-08-06T15:33:49Z","snapshot_observed_at":"2026-08-09T11:38:34.085151Z","submitted_at":"2025-08-06T15:33:49Z","title":"Hierarchical Event Memory for Accurate and Low-latency Online Video Temporal Grounding","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T00:00:03.773233Z"},"links":{"citing_paper":"/paper/2508.04546"},"observation_digest":"sha256:85dffe98243915ca67bdabb28a7f448570227036a836f5a43a729b7c8f57f0cd","observation_id":"6c0b1b3b-d15a-4bca-9b8d-3d113aa5ee20","resolution":{"observed_at":"2026-08-06T00:00:03.992050Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08085","last_updated":"2024-06-30T05:39:46Z","snapshot_observed_at":"2026-08-03T12:09:02.990658Z","submitted_at":"2024-06-12T11:07:55Z","title":"Flash-VStream: Memory-Based Real-Time Understanding for Long Video Streams","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08085","snapshot_observed_at":"2026-08-06T00:00:03.777349Z","title":"Flash-vstream: Memory- based real-time understanding for long video streams.arXiv preprint arXiv:2406.08085, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.04546","last_updated":"2025-08-06T15:33:49Z","snapshot_observed_at":"2026-08-09T11:38:34.085151Z","submitted_at":"2025-08-06T15:33:49Z","title":"Hierarchical Event Memory for Accurate and Low-latency Online Video Temporal Grounding","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T00:00:03.777349Z"},"links":{"cited_paper":"/paper/2406.08085","citing_paper":"/paper/2508.04546"},"observation_digest":"sha256:0c6f8e3d185512727665a76c281c36f2d56cf5132712d2d6f4d85e25210c4fb6","observation_id":"2ba91c3e-102d-4de4-a5c1-c99f9b4b88de","resolution":{"observed_at":"2026-08-06T00:00:03.777349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:00:03.780650Z","title":"Learning 2d temporal adjacent networks for moment local- ization with natural language","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.04546","last_updated":"2025-08-06T15:33:49Z","snapshot_observed_at":"2026-08-09T11:38:34.085151Z","submitted_at":"2025-08-06T15:33:49Z","title":"Hierarchical Event Memory for Accurate and Low-latency Online Video Temporal Grounding","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T00:00:03.780650Z"},"links":{"citing_paper":"/paper/2508.04546"},"observation_digest":"sha256:a92112d8539571303d5dec86e750f1f2c9991b8bd4cd40c43cb1a301e6c3b72f","observation_id":"2e867451-fc1f-4ef8-b0fb-a92529a3c4eb","resolution":{"observed_at":"2026-08-06T00:00:03.780650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:00:03.783553Z","title":"Progressive privileged knowledge distillation for on- line action detection.Pattern Recognition, 129:108741,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.04546","last_updated":"2025-08-06T15:33:49Z","snapshot_observed_at":"2026-08-09T11:38:34.085151Z","submitted_at":"2025-08-06T15:33:49Z","title":"Hierarchical Event Memory for Accurate and Low-latency Online Video Temporal Grounding","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T00:00:03.783553Z"},"links":{"citing_paper":"/paper/2508.04546"},"observation_digest":"sha256:d648a4d3bd69f7aa3d31009feb3fc7b2300495b256df72637f50d8946b473b99","observation_id":"72ce5440-5286-4afc-aff1-fc9f3b1b4b4a","resolution":{"observed_at":"2026-08-06T00:00:03.783553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:00:03.966570Z","title":"Real-time online video detection with temporal smoothing transformers","venue":null,"work_id":"1af1e535-9c45-409e-a917-4cbc4bc77a48","year":2022},"citing_paper":{"arxiv_id":"2508.04546","last_updated":"2025-08-06T15:33:49Z","snapshot_observed_at":"2026-08-09T11:38:34.085151Z","submitted_at":"2025-08-06T15:33:49Z","title":"Hierarchical Event Memory for Accurate and Low-latency Online Video Temporal Grounding","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T00:00:03.786834Z"},"links":{"citing_paper":"/paper/2508.04546"},"observation_digest":"sha256:7a040f8a94769f4781f29b96a03636f967831b164254b2d496115b1d3fc53e9b","observation_id":"37c5946a-cc81-4186-8ffd-5bfe6b5459ba","resolution":{"observed_at":"2026-08-06T00:00:03.970000Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:00:03.955712Z","title":"Unsupervised cross-media hashing learning via knowledge graph.Chinese Journal of Electronics, 31(6):1081–1091, 2022","venue":null,"work_id":"6e435add-8675-47cf-8ecd-4dea7577b546","year":2022},"citing_paper":{"arxiv_id":"2508.04546","last_updated":"2025-08-06T15:33:49Z","snapshot_observed_at":"2026-08-09T11:38:34.085151Z","submitted_at":"2025-08-06T15:33:49Z","title":"Hierarchical Event Memory for Accurate and Low-latency Online Video Temporal Grounding","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T00:00:03.790152Z"},"links":{"citing_paper":"/paper/2508.04546"},"observation_digest":"sha256:101279f8439acc7d5289e9be747afbf4f3160ce5b337cf1744c9aaedbd553854","observation_id":"194be584-97ee-4265-a4a1-44f2a41d1b06","resolution":{"observed_at":"2026-08-06T00:00:03.959228Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:00:03.943350Z","title":"Weakly supervised video moment localization with con- trastive negative sample mining","venue":null,"work_id":"5516c97c-9445-49e1-a699-2bf3864aa367","year":2022},"citing_paper":{"arxiv_id":"2508.04546","last_updated":"2025-08-06T15:33:49Z","snapshot_observed_at":"2026-08-09T11:38:34.085151Z","submitted_at":"2025-08-06T15:33:49Z","title":"Hierarchical Event Memory for Accurate and Low-latency Online Video Temporal Grounding","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T00:00:03.792730Z"},"links":{"citing_paper":"/paper/2508.04546"},"observation_digest":"sha256:78c32cebe01993eea3cf29a5d6401dcc1b865d18a963b5b11fae9cd6d774806f","observation_id":"667feeca-3c4f-479d-a0f3-a69890e413fd","resolution":{"observed_at":"2026-08-06T00:00:03.947534Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:00:03.932033Z","title":"Weakly supervised temporal sentence grounding with gaussian-based contrastive proposal learn- ing","venue":null,"work_id":"1716b7c4-2f4c-4624-bc1e-5f58ee59e468","year":2022},"citing_paper":{"arxiv_id":"2508.04546","last_updated":"2025-08-06T15:33:49Z","snapshot_observed_at":"2026-08-09T11:38:34.085151Z","submitted_at":"2025-08-06T15:33:49Z","title":"Hierarchical Event Memory for Accurate and Low-latency Online Video Temporal Grounding","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T00:00:03.795687Z"},"links":{"citing_paper":"/paper/2508.04546"},"observation_digest":"sha256:4f55713892e221c116456b0215c0d7d725dc2ca46132193f67bc47656a9be038","observation_id":"17cf5ad9-acdc-4bdd-a50b-57c3bc1917ae","resolution":{"observed_at":"2026-08-06T00:00:03.935291Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:00:03.922063Z","title":"Generating structured pseudo labels for noise- resistant zero-shot video sentence localization","venue":null,"work_id":"9830340f-455d-4793-9446-50cd8b6238f9","year":null},"citing_paper":{"arxiv_id":"2508.04546","last_updated":"2025-08-06T15:33:49Z","snapshot_observed_at":"2026-08-09T11:38:34.085151Z","submitted_at":"2025-08-06T15:33:49Z","title":"Hierarchical Event Memory for Accurate and Low-latency Online Video Temporal Grounding","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T00:00:03.798721Z"},"links":{"citing_paper":"/paper/2508.04546"},"observation_digest":"sha256:6b547488a80b540fe899cf6ff7a0c0be79a2ddde4c4c2b13a31687a11d89b66d","observation_id":"74e5305e-d75a-4166-8060-ac84589ef354","resolution":{"observed_at":"2026-08-06T00:00:03.925397Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:00:03.912577Z","title":"Phrase-level temporal relationship mining for temporal sentence localization","venue":null,"work_id":"d8d4f36e-46bb-45a5-9274-42c35b5ece8b","year":2023},"citing_paper":{"arxiv_id":"2508.04546","last_updated":"2025-08-06T15:33:49Z","snapshot_observed_at":"2026-08-09T11:38:34.085151Z","submitted_at":"2025-08-06T15:33:49Z","title":"Hierarchical Event Memory for Accurate and Low-latency Online Video Temporal Grounding","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T00:00:03.801411Z"},"links":{"citing_paper":"/paper/2508.04546"},"observation_digest":"sha256:67d92c91ee33970fe834947ee0833f95000338735b5089dc414dc00991d27de1","observation_id":"786ca839-0407-4b2b-abe6-e4301fabdf27","resolution":{"observed_at":"2026-08-06T00:00:03.915647Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:00:03.901014Z","title":"Training-free video temporal grounding usinglarge-scale pre-trained models","venue":null,"work_id":"7ad1852b-6a8b-4397-ac4f-935e494df967","year":2024},"citing_paper":{"arxiv_id":"2508.04546","last_updated":"2025-08-06T15:33:49Z","snapshot_observed_at":"2026-08-09T11:38:34.085151Z","submitted_at":"2025-08-06T15:33:49Z","title":"Hierarchical Event Memory for Accurate and Low-latency Online Video Temporal Grounding","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T00:00:03.804048Z"},"links":{"citing_paper":"/paper/2508.04546"},"observation_digest":"sha256:e2e0a4e9ae98704633d0a33ba844b668052ae54da2e8185ba5c36ad876300333","observation_id":"f0a2fcde-42ce-43b0-937a-15b51ae2dc2a","resolution":{"observed_at":"2026-08-06T00:00:03.905828Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:00:03.806881Z","title":"Faster and better learning for bounding box regres- sion., 2020, 34.DOI: https://doi","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.04546","last_updated":"2025-08-06T15:33:49Z","snapshot_observed_at":"2026-08-09T11:38:34.085151Z","submitted_at":"2025-08-06T15:33:49Z","title":"Hierarchical Event Memory for Accurate and Low-latency Online Video Temporal Grounding","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T00:00:03.806881Z"},"links":{"citing_paper":"/paper/2508.04546"},"observation_digest":"sha256:880a2589a3915aefce3df50141fef227ceba70ee6be8e685b615ffeca9859be5","observation_id":"9d37da64-71e8-46f9-b5ea-5b159f06b07d","resolution":{"observed_at":"2026-08-06T00:00:03.806881Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2508.04546","last_updated":"2025-08-06T15:33:49Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T11:38:34.085151Z","submitted_at":"2025-08-06T15:33:49Z","title":"Hierarchical Event Memory for Accurate and Low-latency Online Video Temporal Grounding"},"reference_resolution":{"displayed":60,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":15,"verified_exact":0,"verified_fuzzy":44},"total_outbound_references":60},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 60 of 60 outbound references and 0 inbound Pith citation observations for arXiv:2508.04546."}