{"as_of":"2026-08-20T19:48:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:548c6e5c12aefa470aa6a9374c1757009ea29f863a792684f87a91f134ed7aee","coverage":[{"denominator":65,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":65,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T10:16:14.511623Z","state":"measured"},{"denominator":65,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":65,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2504.18689/citation-record","integrity":"/paper/2504.18689/integrity","json":"/paper/2504.18689/citation-record.json","paper":"/paper/2504.18689"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2210.14512","last_updated":"2022-10-26T06:50:07Z","snapshot_observed_at":"2026-08-20T18:35:37.502848Z","submitted_at":"2022-10-26T06:50:07Z","title":"End-to-End Multimodal Representation Learning for Video Dialog","version":1},"cited_work":{"arxiv_id":"2210.14512","doi":null,"metadata_source":"pith","pith_arxiv_id":"2210.14512","snapshot_observed_at":"2026-08-16T10:16:14.751303Z","title":"End-to-End Multimodal Representation Learning for Video Dialog","venue":"cs.CV","work_id":"0a6208d0-59fc-4d30-a904-74d35918f1e3","year":2022},"citing_paper":{"arxiv_id":"2504.18689","last_updated":"2025-04-25T20:30:30Z","snapshot_observed_at":"2026-08-20T04:17:34.379426Z","submitted_at":"2025-04-25T20:30:30Z","title":"HierSum: A Global and Local Attention Mechanism for Video Summarization","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T10:16:14.148228Z"},"links":{"cited_paper":"/paper/2210.14512","citing_paper":"/paper/2504.18689"},"observation_digest":"sha256:aa018977d5011600d7a8e31db7eb156da112d761f79192e9753bdf41bac70242","observation_id":"05e2ee01-a5bf-4bd4-9cdd-e71f7f2fa8d2","resolution":{"observed_at":"2026-08-16T10:16:14.760625Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:16:15.780212Z","title":"Combining global and local attention with positional encoding for video summarization","venue":null,"work_id":"9ae278c4-1686-4528-9e6d-340daea833ae","year":2021},"citing_paper":{"arxiv_id":"2504.18689","last_updated":"2025-04-25T20:30:30Z","snapshot_observed_at":"2026-08-20T04:17:34.379426Z","submitted_at":"2025-04-25T20:30:30Z","title":"HierSum: A Global and Local Attention Mechanism for Video Summarization","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T10:16:14.154802Z"},"links":{"citing_paper":"/paper/2504.18689"},"observation_digest":"sha256:ee758036087ca597793e64201ac719a09a2164474481e38090d05d7d6a02606a","observation_id":"483bba0e-b47a-439d-bc56-1e656545f51a","resolution":{"observed_at":"2026-08-16T10:16:15.785518Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:16:15.762206Z","title":"Summarizing videos using con- centrated attention and considering the uniqueness and diver- sity of the video frames","venue":null,"work_id":"7bdc0dd3-5325-4a16-9f1e-fe5fc1f02298","year":2022},"citing_paper":{"arxiv_id":"2504.18689","last_updated":"2025-04-25T20:30:30Z","snapshot_observed_at":"2026-08-20T04:17:34.379426Z","submitted_at":"2025-04-25T20:30:30Z","title":"HierSum: A Global and Local Attention Mechanism for Video Summarization","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T10:16:14.160005Z"},"links":{"citing_paper":"/paper/2504.18689"},"observation_digest":"sha256:0af512c1b660d06a78f710c3923e2ff7b8a3fbc2ff17ff4030f77d821bd5648e","observation_id":"dbadb52b-916e-44a6-8aa3-7281ce93d5dc","resolution":{"observed_at":"2026-08-16T10:16:15.767690Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:16:14.166644Z","title":"Hiervl: Learning hierarchical video- language embeddings","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.18689","last_updated":"2025-04-25T20:30:30Z","snapshot_observed_at":"2026-08-20T04:17:34.379426Z","submitted_at":"2025-04-25T20:30:30Z","title":"HierSum: A Global and Local Attention Mechanism for Video Summarization","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T10:16:14.166644Z"},"links":{"citing_paper":"/paper/2504.18689"},"observation_digest":"sha256:c3ac71d997f3385056d80173edf7e3fd8866a31e8a022415722a80b1ce86b3b4","observation_id":"e19d93c5-f81b-4aef-9677-e12cb0dea90c","resolution":{"observed_at":"2026-08-16T10:16:14.166644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:16:15.732192Z","title":"Raikwar, and Charul Bhatnagar","venue":null,"work_id":"dc15442d-65fc-4207-ad85-d46555e87679","year":2020},"citing_paper":{"arxiv_id":"2504.18689","last_updated":"2025-04-25T20:30:30Z","snapshot_observed_at":"2026-08-20T04:17:34.379426Z","submitted_at":"2025-04-25T20:30:30Z","title":"HierSum: A Global and Local Attention Mechanism for Video Summarization","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T10:16:14.172249Z"},"links":{"citing_paper":"/paper/2504.18689"},"observation_digest":"sha256:578327c5064b179f53bdc9a37491956343b1d7250dce6b30c11843ea27543c64","observation_id":"61479af6-176c-4b72-8697-92d64739c3df","resolution":{"observed_at":"2026-08-16T10:16:15.738635Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:16:15.713529Z","title":"Text descriptions of actions and objects improve action anticipa- tion","venue":null,"work_id":"4af79ebe-6d8d-497b-b61a-a487432adbf0","year":2025},"citing_paper":{"arxiv_id":"2504.18689","last_updated":"2025-04-25T20:30:30Z","snapshot_observed_at":"2026-08-20T04:17:34.379426Z","submitted_at":"2025-04-25T20:30:30Z","title":"HierSum: A Global and Local Attention Mechanism for Video Summarization","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T10:16:14.178950Z"},"links":{"citing_paper":"/paper/2504.18689"},"observation_digest":"sha256:9f53a7030f0d7896c0ab2412590e09218eb545dfd0c3982fb583148a2cd22de7","observation_id":"851afb90-409a-4938-bf37-00cf430d7262","resolution":{"observed_at":"2026-08-16T10:16:15.719175Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:16:15.695331Z","title":"Leveraging contextual cues for generating basketball high- lights","venue":null,"work_id":"e662b18a-6b5f-4283-bd32-ccb0c21e5263","year":2016},"citing_paper":{"arxiv_id":"2504.18689","last_updated":"2025-04-25T20:30:30Z","snapshot_observed_at":"2026-08-20T04:17:34.379426Z","submitted_at":"2025-04-25T20:30:30Z","title":"HierSum: A Global and Local Attention Mechanism for Video Summarization","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T10:16:14.185171Z"},"links":{"citing_paper":"/paper/2504.18689"},"observation_digest":"sha256:b7bc502679fee86c117eca9d3d08d27ea9360e9c77caa55465e27ab86cdf8088","observation_id":"5fc73e76-92e8-4a38-918b-4c5ce20218b6","resolution":{"observed_at":"2026-08-16T10:16:15.700746Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:16:15.670831Z","title":"Videosage: Video summarization with graph representation learning","venue":null,"work_id":"60762e82-6c1d-45f9-b7b6-d530d542aa3a","year":2024},"citing_paper":{"arxiv_id":"2504.18689","last_updated":"2025-04-25T20:30:30Z","snapshot_observed_at":"2026-08-20T04:17:34.379426Z","submitted_at":"2025-04-25T20:30:30Z","title":"HierSum: A Global and Local Attention Mechanism for Video Summarization","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T10:16:14.190997Z"},"links":{"citing_paper":"/paper/2504.18689"},"observation_digest":"sha256:9bd097401a15331419532d407fd3016e1bae8c6add785ef4cb9d99d98b5a6e40","observation_id":"1e71c784-09d8-42f1-bc9e-00d5b6a84432","resolution":{"observed_at":"2026-08-16T10:16:15.681823Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.01262","last_updated":"2023-09-03T20:00:37Z","snapshot_observed_at":"2026-08-19T01:22:44.201088Z","submitted_at":"2023-09-03T20:00:37Z","title":"Multimodal Contrastive Learning with Hard Negative Sampling for Human Activity Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.01262","snapshot_observed_at":"2026-08-16T10:16:14.195949Z","title":"Multimodal contrastive learning with hard negative sampling for human activity recognition","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.18689","last_updated":"2025-04-25T20:30:30Z","snapshot_observed_at":"2026-08-20T04:17:34.379426Z","submitted_at":"2025-04-25T20:30:30Z","title":"HierSum: A Global and Local Attention Mechanism for Video Summarization","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T10:16:14.195949Z"},"links":{"cited_paper":"/paper/2309.01262","citing_paper":"/paper/2504.18689"},"observation_digest":"sha256:b4419c1c37150d573d4c839063fbd658276e9eb066fffe316a4f01dce14097f7","observation_id":"6c1f59b7-15ad-4b9c-b387-6e6a139e4baa","resolution":{"observed_at":"2026-08-16T10:16:14.195949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:16:15.650302Z","title":"Vsumm: A mechanism designed to produce static video summaries and a novel evaluation method","venue":null,"work_id":"fd075a07-5620-4789-8a45-91e0ce735194","year":2011},"citing_paper":{"arxiv_id":"2504.18689","last_updated":"2025-04-25T20:30:30Z","snapshot_observed_at":"2026-08-20T04:17:34.379426Z","submitted_at":"2025-04-25T20:30:30Z","title":"HierSum: A Global and Local Attention Mechanism for Video Summarization","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T10:16:14.201329Z"},"links":{"citing_paper":"/paper/2504.18689"},"observation_digest":"sha256:6973923015c439c1b25680cc9e01893b401a438115c3acb04172eead9df07ed2","observation_id":"70f4401b-18de-4a63-8374-e13797afadac","resolution":{"observed_at":"2026-08-16T10:16:15.658376Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:16:15.631777Z","title":"Video summarization via segments summary graphs","venue":null,"work_id":"0be5d3c5-a21d-4b62-9981-ab6139baf1ab","year":2015},"citing_paper":{"arxiv_id":"2504.18689","last_updated":"2025-04-25T20:30:30Z","snapshot_observed_at":"2026-08-20T04:17:34.379426Z","submitted_at":"2025-04-25T20:30:30Z","title":"HierSum: A Global and Local Attention Mechanism for Video Summarization","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T10:16:14.206403Z"},"links":{"citing_paper":"/paper/2504.18689"},"observation_digest":"sha256:cd51ef05c15eca130be3571914cec9696f1feab3b1f262a5e91f1ead76cca25e","observation_id":"146fa7d9-ce8a-4e54-aa82-cd7c8698dfb6","resolution":{"observed_at":"2026-08-16T10:16:15.637439Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:16:15.612096Z","title":"Bert: Pre-training of deep bidirectional trans- formers for language understanding","venue":null,"work_id":"87f09614-016d-4e3a-8eda-d3800b3f11ad","year":2019},"citing_paper":{"arxiv_id":"2504.18689","last_updated":"2025-04-25T20:30:30Z","snapshot_observed_at":"2026-08-20T04:17:34.379426Z","submitted_at":"2025-04-25T20:30:30Z","title":"HierSum: A Global and Local Attention Mechanism for Video Summarization","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T10:16:14.212678Z"},"links":{"citing_paper":"/paper/2504.18689"},"observation_digest":"sha256:b306aca80131f4639770bf2be8d172c3847e06f7cfbf8b1e3369855e501d7ed8","observation_id":"46ef75ee-e9b9-4e9e-ad98-8f584fa4a947","resolution":{"observed_at":"2026-08-16T10:16:15.618557Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.11513","last_updated":"2025-01-30T22:50:16Z","snapshot_observed_at":"2026-08-16T13:17:42.617441Z","submitted_at":"2024-09-17T19:36:37Z","title":"Mamba Fusion: Learning Actions Through Questioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.11513","snapshot_observed_at":"2026-08-16T10:16:14.218921Z","title":"Mamba fusion: Learning actions through questioning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.18689","last_updated":"2025-04-25T20:30:30Z","snapshot_observed_at":"2026-08-20T04:17:34.379426Z","submitted_at":"2025-04-25T20:30:30Z","title":"HierSum: A Global and Local Attention Mechanism for Video Summarization","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T10:16:14.218921Z"},"links":{"cited_paper":"/paper/2409.11513","citing_paper":"/paper/2504.18689"},"observation_digest":"sha256:59adae12135e76d161257c0a6e0a971aa23c9af5a8c4d84bf0f610a10186ade6","observation_id":"d5f36b14-89cb-4276-b9dc-4bb2458d9429","resolution":{"observed_at":"2026-08-16T10:16:14.218921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:16:15.587726Z","title":"Summarizing videos with attention","venue":null,"work_id":"aa29974e-4184-4f82-94cf-99e414853694","year":2018},"citing_paper":{"arxiv_id":"2504.18689","last_updated":"2025-04-25T20:30:30Z","snapshot_observed_at":"2026-08-20T04:17:34.379426Z","submitted_at":"2025-04-25T20:30:30Z","title":"HierSum: A Global and Local Attention Mechanism for Video Summarization","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T10:16:14.224717Z"},"links":{"citing_paper":"/paper/2504.18689"},"observation_digest":"sha256:844ae8c8770446db1871309c9d2844c3744a57a8979fd6a896f033a1af9016ef","observation_id":"7dbe4562-e868-4d95-b19e-86bf4e7ed079","resolution":{"observed_at":"2026-08-16T10:16:15.594103Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:16:14.236148Z","title":"Slowfast networks for video recognition","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2504.18689","last_updated":"2025-04-25T20:30:30Z","snapshot_observed_at":"2026-08-20T04:17:34.379426Z","submitted_at":"2025-04-25T20:30:30Z","title":"HierSum: A Global and Local Attention Mechanism for Video Summarization","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T10:16:14.236148Z"},"links":{"citing_paper":"/paper/2504.18689"},"observation_digest":"sha256:757a59172910b273d751da85575d2bc33ba2976d6c8c2af7880e13f3c5a53b8b","observation_id":"b487e608-378b-41ee-847e-2045e55f8c0a","resolution":{"observed_at":"2026-08-16T10:16:14.236148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:16:15.532566Z","title":"Youtube video player updates: Most replayed, video chapters, single loop & more","venue":null,"work_id":"db1ed17c-e4cd-4fcc-9455-3dfb4ab45a2e","year":2022},"citing_paper":{"arxiv_id":"2504.18689","last_updated":"2025-04-25T20:30:30Z","snapshot_observed_at":"2026-08-20T04:17:34.379426Z","submitted_at":"2025-04-25T20:30:30Z","title":"HierSum: A Global and Local Attention Mechanism for Video Summarization","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T10:16:14.241291Z"},"links":{"citing_paper":"/paper/2504.18689"},"observation_digest":"sha256:735f110e5d0a8d536aa8177a3c1ee4827e69c9e7e29e853efac184b4451f1a2a","observation_id":"dd3a7631-97c8-422c-8958-3f33f22e572a","resolution":{"observed_at":"2026-08-16T10:16:15.538675Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.13382","last_updated":"2025-02-01T03:55:30Z","snapshot_observed_at":"2026-08-19T07:24:41.152560Z","submitted_at":"2024-05-22T06:31:42Z","title":"VTG-LLM: Integrating Timestamp Knowledge into Video LLMs for Enhanced Video Temporal Grounding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.13382","snapshot_observed_at":"2026-08-16T10:16:14.246480Z","title":"Vtg-llm: Integrating timestamp knowledge into video llms for enhanced video temporal grounding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.18689","last_updated":"2025-04-25T20:30:30Z","snapshot_observed_at":"2026-08-20T04:17:34.379426Z","submitted_at":"2025-04-25T20:30:30Z","title":"HierSum: A Global and Local Attention Mechanism for Video Summarization","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T10:16:14.246480Z"},"links":{"cited_paper":"/paper/2405.13382","citing_paper":"/paper/2504.18689"},"observation_digest":"sha256:e0f5a6090ff01d8e2947d5672a3271066bf36f714fda3b947849757f1ff39a9c","observation_id":"6b6a7873-0b2a-4a95-a77e-a1b753ca0622","resolution":{"observed_at":"2026-08-16T10:16:14.246480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:16:15.513937Z","title":"Creating summaries from user videos","venue":null,"work_id":"8e160f85-a9fe-43c1-97fe-02bf9f33e871","year":2014},"citing_paper":{"arxiv_id":"2504.18689","last_updated":"2025-04-25T20:30:30Z","snapshot_observed_at":"2026-08-20T04:17:34.379426Z","submitted_at":"2025-04-25T20:30:30Z","title":"HierSum: A Global and Local Attention Mechanism for Video Summarization","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T10:16:14.251680Z"},"links":{"citing_paper":"/paper/2504.18689"},"observation_digest":"sha256:5d1977db960e83d284fbca4bc1d13d545b3c1af25781bccadc9ff760f82111f3","observation_id":"a44718c3-75fb-4f1d-b8fd-b2f3f705ed02","resolution":{"observed_at":"2026-08-16T10:16:15.520269Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.10300","last_updated":"2025-02-05T09:57:59Z","snapshot_observed_at":"2026-08-16T14:34:13.332518Z","submitted_at":"2023-12-16T03:17:30Z","title":"Shot2Story: A New Benchmark for Comprehensive Understanding of Multi-shot Videos","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.10300","snapshot_observed_at":"2026-08-16T10:16:14.257002Z","title":"Shot2story20k: A new benchmark for comprehen- sive understanding of multi-shot videos","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.18689","last_updated":"2025-04-25T20:30:30Z","snapshot_observed_at":"2026-08-20T04:17:34.379426Z","submitted_at":"2025-04-25T20:30:30Z","title":"HierSum: A Global and Local Attention Mechanism for Video Summarization","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T10:16:14.257002Z"},"links":{"cited_paper":"/paper/2312.10300","citing_paper":"/paper/2504.18689"},"observation_digest":"sha256:2b60048014fbc9b77d1dd831fd39035a01858d57a53ce75d72bf22fbea2a23c1","observation_id":"b83b5420-27f1-4c63-b49d-8cb15adf2758","resolution":{"observed_at":"2026-08-16T10:16:14.257002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:16:15.491267Z","title":"Limitations in employing natural language supervision for sensor-based human activity recognition-and ways to overcome them","venue":null,"work_id":"a709a0d8-7bf4-4ab0-b5ad-f62912942cbd","year":2025},"citing_paper":{"arxiv_id":"2504.18689","last_updated":"2025-04-25T20:30:30Z","snapshot_observed_at":"2026-08-20T04:17:34.379426Z","submitted_at":"2025-04-25T20:30:30Z","title":"HierSum: A Global and Local Attention Mechanism for Video Summarization","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T10:16:14.262296Z"},"links":{"citing_paper":"/paper/2504.18689"},"observation_digest":"sha256:1c862d4c70a77a62855fa6e6138beb921a04b0d03154c2108aaece44747c85a4","observation_id":"759694c4-83f5-44d2-a6b1-d4808a7927c0","resolution":{"observed_at":"2026-08-16T10:16:15.498338Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:16:15.472733Z","title":"Align and attend: Multimodal summarization with dual contrastive losses","venue":null,"work_id":"60252723-a034-4233-bac1-41c381dc1e9b","year":2023},"citing_paper":{"arxiv_id":"2504.18689","last_updated":"2025-04-25T20:30:30Z","snapshot_observed_at":"2026-08-20T04:17:34.379426Z","submitted_at":"2025-04-25T20:30:30Z","title":"HierSum: A Global and Local Attention Mechanism for Video Summarization","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T10:16:14.268593Z"},"links":{"citing_paper":"/paper/2504.18689"},"observation_digest":"sha256:8a95879cc63a52460fa0661eac3befe9838b811dac9752f1681ee4fea5c584da","observation_id":"184267c0-1472-4a53-ba8f-d134a5f1c239","resolution":{"observed_at":"2026-08-16T10:16:15.478322Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:16:15.451249Z","title":"V2xum-llm: Cross-modal video summarization with tem- poral prompt instruction tuning","venue":null,"work_id":"bd13b3b9-faca-4b72-babb-25ed58df7cc4","year":2025},"citing_paper":{"arxiv_id":"2504.18689","last_updated":"2025-04-25T20:30:30Z","snapshot_observed_at":"2026-08-20T04:17:34.379426Z","submitted_at":"2025-04-25T20:30:30Z","title":"HierSum: A Global and Local Attention Mechanism for Video Summarization","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T10:16:14.273765Z"},"links":{"citing_paper":"/paper/2504.18689"},"observation_digest":"sha256:da592578b4e150b52ed3ce4d3ea0b571e2b7b5352b7716bb97d3ffceb500ee5d","observation_id":"4ad39757-796e-4f45-9f4b-02cc457e8528","resolution":{"observed_at":"2026-08-16T10:16:15.459729Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:16:15.425188Z","title":"Cluster-based video summa- rization with temporal context awareness","venue":null,"work_id":"c170af52-a001-46c4-a8e2-5d32bb99c387","year":2023},"citing_paper":{"arxiv_id":"2504.18689","last_updated":"2025-04-25T20:30:30Z","snapshot_observed_at":"2026-08-20T04:17:34.379426Z","submitted_at":"2025-04-25T20:30:30Z","title":"HierSum: A Global and Local Attention Mechanism for Video Summarization","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T10:16:14.279382Z"},"links":{"citing_paper":"/paper/2504.18689"},"observation_digest":"sha256:dba90bd3070a8b8674a4b8abb059fac75ce5b7a549cb93a2be00a5f4dff628a3","observation_id":"723a9066-1019-4225-8b79-d5342f0f567d","resolution":{"observed_at":"2026-08-16T10:16:15.435991Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:16:15.404577Z","title":"Video summarization with attention-based encoder–decoder networks","venue":null,"work_id":"0dbec50d-659f-4ae8-a16b-15ffdc408ff0","year":2019},"citing_paper":{"arxiv_id":"2504.18689","last_updated":"2025-04-25T20:30:30Z","snapshot_observed_at":"2026-08-20T04:17:34.379426Z","submitted_at":"2025-04-25T20:30:30Z","title":"HierSum: A Global and Local Attention Mechanism for Video Summarization","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T10:16:14.284204Z"},"links":{"citing_paper":"/paper/2504.18689"},"observation_digest":"sha256:547eba086a54dad0fdc81302017c6597de3d36cd7f69cb2cf74784e47cb91408","observation_id":"0cf47577-5c8a-4be0-92ec-387d08805fd0","resolution":{"observed_at":"2026-08-16T10:16:15.410806Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:16:15.387476Z","title":"Joint video summarization and moment localization by cross-task sample transfer","venue":null,"work_id":"79435809-2662-43a9-90ad-688a8cc015d0","year":2022},"citing_paper":{"arxiv_id":"2504.18689","last_updated":"2025-04-25T20:30:30Z","snapshot_observed_at":"2026-08-20T04:17:34.379426Z","submitted_at":"2025-04-25T20:30:30Z","title":"HierSum: A Global and Local Attention Mechanism for Video Summarization","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T10:16:14.289622Z"},"links":{"citing_paper":"/paper/2504.18689"},"observation_digest":"sha256:9ec8c9e2183af6b04f7a9db35280a3b21b7af090e74bd6d3fabfd37d7e3ddb98","observation_id":"7c0f0809-b459-43dd-9b9d-b0e3ea5e514d","resolution":{"observed_at":"2026-08-16T10:16:15.392813Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:16:15.368686Z","title":"Discriminative feature learning for un- supervised video summarization","venue":null,"work_id":"0584abcd-9ae8-4141-bb50-8a5a20e8fe2b","year":2019},"citing_paper":{"arxiv_id":"2504.18689","last_updated":"2025-04-25T20:30:30Z","snapshot_observed_at":"2026-08-20T04:17:34.379426Z","submitted_at":"2025-04-25T20:30:30Z","title":"HierSum: A Global and Local Attention Mechanism for Video Summarization","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T10:16:14.294711Z"},"links":{"citing_paper":"/paper/2504.18689"},"observation_digest":"sha256:c37edfda86a89f735408ec944401edc192e204f68c8c7185a93a868bfe072e5a","observation_id":"1b2db47e-5fde-4d02-ab8b-a35566d17958","resolution":{"observed_at":"2026-08-16T10:16:15.374573Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.13461","last_updated":"2019-10-29T18:01:00Z","snapshot_observed_at":"2026-07-06T08:33:12.534026Z","submitted_at":"2019-10-29T18:01:00Z","title":"BART: Denoising Sequence-to-Sequence Pre-training for Natural Language Generation, Translation, and Comprehension","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.13461","snapshot_observed_at":"2026-08-16T10:16:14.300362Z","title":"Bart: Denoising sequence-to-sequence pre-training for natural language generation, translation, and comprehension","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2504.18689","last_updated":"2025-04-25T20:30:30Z","snapshot_observed_at":"2026-08-20T04:17:34.379426Z","submitted_at":"2025-04-25T20:30:30Z","title":"HierSum: A Global and Local Attention Mechanism for Video Summarization","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T10:16:14.300362Z"},"links":{"cited_paper":"/paper/1910.13461","citing_paper":"/paper/2504.18689"},"observation_digest":"sha256:7495b7f7a18c1fef17e304f2e2a4c9e4ffa730cea8a9511fb1302a6f116270ff","observation_id":"691b8176-05a2-4072-81c9-1171cfd57cff","resolution":{"observed_at":"2026-08-16T10:16:14.300362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:16:15.349331Z","title":"Multi-modal summarization for asyn- chronous collection of text, image, audio and video","venue":null,"work_id":"78b0ed85-2be2-4d07-aedf-cb6856e3ccb3","year":2017},"citing_paper":{"arxiv_id":"2504.18689","last_updated":"2025-04-25T20:30:30Z","snapshot_observed_at":"2026-08-20T04:17:34.379426Z","submitted_at":"2025-04-25T20:30:30Z","title":"HierSum: A Global and Local Attention Mechanism for Video Summarization","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T10:16:14.306408Z"},"links":{"citing_paper":"/paper/2504.18689"},"observation_digest":"sha256:9d1d91937bcfeb317357404671b8844d276b40707cc421823e826f20b26b9482","observation_id":"443584bd-39d4-4973-8dd1-c19f5bbd4a9b","resolution":{"observed_at":"2026-08-16T10:16:15.356291Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:16:15.326297Z","title":"Read, watch, listen, and summarize: Multi-modal summarization for asynchronous text, image, audio and video","venue":null,"work_id":"b6fefc3d-e80a-4919-b203-e7e32da93364","year":2018},"citing_paper":{"arxiv_id":"2504.18689","last_updated":"2025-04-25T20:30:30Z","snapshot_observed_at":"2026-08-20T04:17:34.379426Z","submitted_at":"2025-04-25T20:30:30Z","title":"HierSum: A Global and Local Attention Mechanism for Video Summarization","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-16T10:16:14.312075Z"},"links":{"citing_paper":"/paper/2504.18689"},"observation_digest":"sha256:ee5ec461099db6aa5e5195ddd42ea637379a4e9bc9335072b0e49157eb2ebdd4","observation_id":"e46184de-356d-4e8d-87d0-133f027e4577","resolution":{"observed_at":"2026-08-16T10:16:15.332411Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.00200","last_updated":"2020-09-29T20:37:17Z","snapshot_observed_at":"2026-08-13T09:35:23.538598Z","submitted_at":"2020-05-01T03:49:26Z","title":"HERO: Hierarchical Encoder for Video+Language Omni-representation Pre-training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.00200","snapshot_observed_at":"2026-08-16T10:16:14.317594Z","title":"Hero: Hierarchical encoder for video+ language omni-representation pre-training","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2504.18689","last_updated":"2025-04-25T20:30:30Z","snapshot_observed_at":"2026-08-20T04:17:34.379426Z","submitted_at":"2025-04-25T20:30:30Z","title":"HierSum: A Global and Local Attention Mechanism for Video Summarization","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-16T10:16:14.317594Z"},"links":{"cited_paper":"/paper/2005.00200","citing_paper":"/paper/2504.18689"},"observation_digest":"sha256:bf17b0a95eb2cca5dd95b02806b275e8be14a8f0ca1b5e7291051826a379bf6f","observation_id":"d47c1bce-e1cd-4041-b537-6e78ce544380","resolution":{"observed_at":"2026-08-16T10:16:14.317594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:16:14.323842Z","title":"Rouge: A package for automatic evaluation of summaries","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2504.18689","last_updated":"2025-04-25T20:30:30Z","snapshot_observed_at":"2026-08-20T04:17:34.379426Z","submitted_at":"2025-04-25T20:30:30Z","title":"HierSum: A Global and Local Attention Mechanism for Video Summarization","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-16T10:16:14.323842Z"},"links":{"citing_paper":"/paper/2504.18689"},"observation_digest":"sha256:f4e92e21ca0f5b6281f1e1b85dc2b85f477952dfd6920e30d2e062a2d8551c4f","observation_id":"cb91166b-b030-49b7-b811-37e5cdcbd6da","resolution":{"observed_at":"2026-08-16T10:16:14.323842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:16:15.294033Z","title":"Videoxum: Cross- modal visual and textural summarization of videos","venue":null,"work_id":"54b5e60f-197d-49db-bb9d-24b39fc40588","year":2023},"citing_paper":{"arxiv_id":"2504.18689","last_updated":"2025-04-25T20:30:30Z","snapshot_observed_at":"2026-08-20T04:17:34.379426Z","submitted_at":"2025-04-25T20:30:30Z","title":"HierSum: A Global and Local Attention Mechanism for Video Summarization","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-16T10:16:14.330378Z"},"links":{"citing_paper":"/paper/2504.18689"},"observation_digest":"sha256:5361d402cdeee9099dffc9e01e65a9c306ab49166c4e8b1f82bbe2b31d53fd66","observation_id":"5d1a5e4a-c1e2-48e9-952b-c88ee0b11c4c","resolution":{"observed_at":"2026-08-16T10:16:15.299232Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:16:14.337272Z","title":"Univtg: Towards unified video- language temporal grounding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.18689","last_updated":"2025-04-25T20:30:30Z","snapshot_observed_at":"2026-08-20T04:17:34.379426Z","submitted_at":"2025-04-25T20:30:30Z","title":"HierSum: A Global and Local Attention Mechanism for Video Summarization","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-16T10:16:14.337272Z"},"links":{"citing_paper":"/paper/2504.18689"},"observation_digest":"sha256:ecc41566b064a5e96de6d60a07bcd340099ee2f6c2d354b025103dbda15ddc9c","observation_id":"27c8931e-efe9-40b1-8b53-28f549d78cc1","resolution":{"observed_at":"2026-08-16T10:16:14.337272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:16:14.343192Z","title":"Focal loss for dense object detection","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2504.18689","last_updated":"2025-04-25T20:30:30Z","snapshot_observed_at":"2026-08-20T04:17:34.379426Z","submitted_at":"2025-04-25T20:30:30Z","title":"HierSum: A Global and Local Attention Mechanism for Video Summarization","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-16T10:16:14.343192Z"},"links":{"citing_paper":"/paper/2504.18689"},"observation_digest":"sha256:e99cfe07e0e9d18f00153a3497076a9da6b847e1b0d799c228dcba7ee5f5f604","observation_id":"61cb78d7-5cac-4285-8351-fce4a12d8407","resolution":{"observed_at":"2026-08-16T10:16:14.343192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:16:15.249292Z","title":"Ubiss: A unified frame- work for bimodal semantic summarization of videos","venue":null,"work_id":"efa9f917-b4c8-490a-84be-e33b3fb70b89","year":2024},"citing_paper":{"arxiv_id":"2504.18689","last_updated":"2025-04-25T20:30:30Z","snapshot_observed_at":"2026-08-20T04:17:34.379426Z","submitted_at":"2025-04-25T20:30:30Z","title":"HierSum: A Global and Local Attention Mechanism for Video Summarization","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-16T10:16:14.350811Z"},"links":{"citing_paper":"/paper/2504.18689"},"observation_digest":"sha256:0a50fdac3d6dec8cf7bcd271b856346a1a7ad4c74c3747878419b869c33666b0","observation_id":"bb021987-533d-4241-9fa1-e7b81ffcf46c","resolution":{"observed_at":"2026-08-16T10:16:15.255234Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1906.04165","last_updated":"2019-06-07T19:50:30Z","snapshot_observed_at":"2026-08-19T05:19:39.278192Z","submitted_at":"2019-06-07T19:50:30Z","title":"Leveraging BERT for Extractive Text Summarization on Lectures","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.04165","snapshot_observed_at":"2026-08-16T10:16:14.357665Z","title":"Leveraging bert for extractive text summariza- tion on lectures","venue":null,"work_id":null,"year":1906},"citing_paper":{"arxiv_id":"2504.18689","last_updated":"2025-04-25T20:30:30Z","snapshot_observed_at":"2026-08-20T04:17:34.379426Z","submitted_at":"2025-04-25T20:30:30Z","title":"HierSum: A Global and Local Attention Mechanism for Video Summarization","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-16T10:16:14.357665Z"},"links":{"cited_paper":"/paper/1906.04165","citing_paper":"/paper/2504.18689"},"observation_digest":"sha256:1422e447cd146f17da8bfe805c5a946b69d0ccfa6a9eb1177a1e654739b6dec1","observation_id":"a3952f32-f1b1-4326-a608-047e0b10314f","resolution":{"observed_at":"2026-08-16T10:16:14.357665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:16:14.364080Z","title":"Clip-it! language-guided video summarization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.18689","last_updated":"2025-04-25T20:30:30Z","snapshot_observed_at":"2026-08-20T04:17:34.379426Z","submitted_at":"2025-04-25T20:30:30Z","title":"HierSum: A Global and Local Attention Mechanism for Video Summarization","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-16T10:16:14.364080Z"},"links":{"citing_paper":"/paper/2504.18689"},"observation_digest":"sha256:ed59bf318e8f759b5a70a74110e1450ef72aff4ef14eb7080caa6b76415112bb","observation_id":"d4c8902d-ff67-4fee-8b7a-959856dd9d74","resolution":{"observed_at":"2026-08-16T10:16:14.364080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:16:15.216263Z","title":"Tl; dw? summarizing instructional videos with task relevance and cross-modal saliency","venue":null,"work_id":"52369111-181d-410b-bf31-8b80a9bfebff","year":2022},"citing_paper":{"arxiv_id":"2504.18689","last_updated":"2025-04-25T20:30:30Z","snapshot_observed_at":"2026-08-20T04:17:34.379426Z","submitted_at":"2025-04-25T20:30:30Z","title":"HierSum: A Global and Local Attention Mechanism for Video Summarization","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-16T10:16:14.369938Z"},"links":{"citing_paper":"/paper/2504.18689"},"observation_digest":"sha256:30fd3a74e89a512e31ad07df486ba5583b3bd42ad7b0f622fce6ff0aa8d80b61","observation_id":"520bf2a4-0fd5-458f-a610-262a61781e5d","resolution":{"observed_at":"2026-08-16T10:16:15.222378Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:16:15.197933Z","title":"Video summarization using deep se- mantic features","venue":null,"work_id":"246bbac2-a58f-47c0-9ad7-fce065c2d501","year":2016},"citing_paper":{"arxiv_id":"2504.18689","last_updated":"2025-04-25T20:30:30Z","snapshot_observed_at":"2026-08-20T04:17:34.379426Z","submitted_at":"2025-04-25T20:30:30Z","title":"HierSum: A Global and Local Attention Mechanism for Video Summarization","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-16T10:16:14.375353Z"},"links":{"citing_paper":"/paper/2504.18689"},"observation_digest":"sha256:1de38607701794e39c826836e717986f32f3ea1e4c02195bede3a7b702793729","observation_id":"e076ce72-7d49-4416-8715-14bfc2a9cb72","resolution":{"observed_at":"2026-08-16T10:16:15.203437Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:16:14.381334Z","title":"Sumgraph: Video summarization via recursive graph modeling","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.18689","last_updated":"2025-04-25T20:30:30Z","snapshot_observed_at":"2026-08-20T04:17:34.379426Z","submitted_at":"2025-04-25T20:30:30Z","title":"HierSum: A Global and Local Attention Mechanism for Video Summarization","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-16T10:16:14.381334Z"},"links":{"citing_paper":"/paper/2504.18689"},"observation_digest":"sha256:5e7d37f24ad6e7754db5198bc99269da65f9ba0b85c3a800b9c449c5625f0ed5","observation_id":"fa2ad469-25fb-49f5-b449-0d3da81f1f44","resolution":{"observed_at":"2026-08-16T10:16:14.381334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:16:14.386191Z","title":"Enhancing video summarization via vision-language embed- ding","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2504.18689","last_updated":"2025-04-25T20:30:30Z","snapshot_observed_at":"2026-08-20T04:17:34.379426Z","submitted_at":"2025-04-25T20:30:30Z","title":"HierSum: A Global and Local Attention Mechanism for Video Summarization","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-16T10:16:14.386191Z"},"links":{"citing_paper":"/paper/2504.18689"},"observation_digest":"sha256:b8d34a5cdb4fde4287177279a6adf4a29f799a75d8ae9e98a7d58dbfd27c8111","observation_id":"d03055d8-16dd-4eed-be80-65651c7c2c28","resolution":{"observed_at":"2026-08-16T10:16:14.386191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:16:15.157840Z","title":"Category-specific video summarization","venue":null,"work_id":"a35f0c66-f1b0-447d-be8a-bd5ad43f2c19","year":2014},"citing_paper":{"arxiv_id":"2504.18689","last_updated":"2025-04-25T20:30:30Z","snapshot_observed_at":"2026-08-20T04:17:34.379426Z","submitted_at":"2025-04-25T20:30:30Z","title":"HierSum: A Global and Local Attention Mechanism for Video Summarization","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-16T10:16:14.391513Z"},"links":{"citing_paper":"/paper/2504.18689"},"observation_digest":"sha256:9e93ffde267ab300cde76dfcf2d9d5f5da99937cad267b63a7aec60e1caefeb4","observation_id":"10af8396-b734-4401-8cc5-de3983b5079d","resolution":{"observed_at":"2026-08-16T10:16:15.162867Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:16:15.138891Z","title":"Liveseg: Unsupervised multi- modal temporal segmentation of long livestream videos","venue":null,"work_id":"734716a2-0a00-4a8c-b017-472529ffeb71","year":2023},"citing_paper":{"arxiv_id":"2504.18689","last_updated":"2025-04-25T20:30:30Z","snapshot_observed_at":"2026-08-20T04:17:34.379426Z","submitted_at":"2025-04-25T20:30:30Z","title":"HierSum: A Global and Local Attention Mechanism for Video Summarization","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-16T10:16:14.397027Z"},"links":{"citing_paper":"/paper/2504.18689"},"observation_digest":"sha256:c98acb142b24a74a6e5f590ffc3d904e56138560e70f7c51d2d07d549ed812a4","observation_id":"9a100ed0-9694-47f4-b00d-eef152ba4341","resolution":{"observed_at":"2026-08-16T10:16:15.146618Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:16:15.116707Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":"3914ada5-7f95-4900-b1d2-3fa8d1f58e71","year":2021},"citing_paper":{"arxiv_id":"2504.18689","last_updated":"2025-04-25T20:30:30Z","snapshot_observed_at":"2026-08-20T04:17:34.379426Z","submitted_at":"2025-04-25T20:30:30Z","title":"HierSum: A Global and Local Attention Mechanism for Video Summarization","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-16T10:16:14.402347Z"},"links":{"citing_paper":"/paper/2504.18689"},"observation_digest":"sha256:b6c86fd4fe37c0ae7ef73efeb87e2b39530d52462ce116a50ae8b304e136e63c","observation_id":"7a8eb9e0-deed-4d28-9303-b4614e2f59e3","resolution":{"observed_at":"2026-08-16T10:16:15.123896Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:16:15.088296Z","title":"Robust speech recognition via large-scale weak supervision","venue":null,"work_id":"ce56dc66-a4c5-4b57-ae88-a635767a83bf","year":2023},"citing_paper":{"arxiv_id":"2504.18689","last_updated":"2025-04-25T20:30:30Z","snapshot_observed_at":"2026-08-20T04:17:34.379426Z","submitted_at":"2025-04-25T20:30:30Z","title":"HierSum: A Global and Local Attention Mechanism for Video Summarization","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-16T10:16:14.407179Z"},"links":{"citing_paper":"/paper/2504.18689"},"observation_digest":"sha256:64d885495d0289b376da29e16bc65a7df336cfc5e2cf5e5acd7cadc03771af68","observation_id":"fe31180a-18ec-4352-998e-e96fe72f725a","resolution":{"observed_at":"2026-08-16T10:16:15.095239Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:16:15.070495Z","title":"Sentence-bert: Sentence embeddings using siamese bert-networks","venue":null,"work_id":"f37e719a-d4f4-4600-867b-0e3d7bddd001","year":2019},"citing_paper":{"arxiv_id":"2504.18689","last_updated":"2025-04-25T20:30:30Z","snapshot_observed_at":"2026-08-20T04:17:34.379426Z","submitted_at":"2025-04-25T20:30:30Z","title":"HierSum: A Global and Local Attention Mechanism for Video Summarization","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-16T10:16:14.412309Z"},"links":{"citing_paper":"/paper/2504.18689"},"observation_digest":"sha256:79666d84d6ad1ac6d106c67929652add1c6b567aa48b0a18c3b22a7b693f0cca","observation_id":"ffeb6102-c1d2-4b31-bac7-e52ada2f9b2c","resolution":{"observed_at":"2026-08-16T10:16:15.076237Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:16:15.051200Z","title":"Everything at once-multi- modal fusion transformer for video retrieval","venue":null,"work_id":"e1edef76-b809-4ad7-adca-41a6ba1ef9f6","year":2022},"citing_paper":{"arxiv_id":"2504.18689","last_updated":"2025-04-25T20:30:30Z","snapshot_observed_at":"2026-08-20T04:17:34.379426Z","submitted_at":"2025-04-25T20:30:30Z","title":"HierSum: A Global and Local Attention Mechanism for Video Summarization","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-16T10:16:14.417348Z"},"links":{"citing_paper":"/paper/2504.18689"},"observation_digest":"sha256:712d4bea8d2a0491487b124f55f2940fb28ed457b8df5a863d01c1d794b0a9fc","observation_id":"e7ac5774-3496-4ab9-8489-3307294fc814","resolution":{"observed_at":"2026-08-16T10:16:15.057241Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:16:15.030099Z","title":"Tvsum: Summarizing web videos using titles","venue":null,"work_id":"ab668f56-6b9b-406f-b205-17241a60e81d","year":2015},"citing_paper":{"arxiv_id":"2504.18689","last_updated":"2025-04-25T20:30:30Z","snapshot_observed_at":"2026-08-20T04:17:34.379426Z","submitted_at":"2025-04-25T20:30:30Z","title":"HierSum: A Global and Local Attention Mechanism for Video Summarization","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-16T10:16:14.422606Z"},"links":{"citing_paper":"/paper/2504.18689"},"observation_digest":"sha256:cd4a75de7d00c0c811ce71d672f9b7edccc7e947b71d90529940fac749153caa","observation_id":"beb263a6-1833-4c48-bafe-8ed090503368","resolution":{"observed_at":"2026-08-16T10:16:15.036407Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:16:15.011616Z","title":null,"venue":null,"work_id":"b36e5a1a-06de-472b-98f5-d0711ec6ede9","year":2024},"citing_paper":{"arxiv_id":"2504.18689","last_updated":"2025-04-25T20:30:30Z","snapshot_observed_at":"2026-08-20T04:17:34.379426Z","submitted_at":"2025-04-25T20:30:30Z","title":"HierSum: A Global and Local Attention Mechanism for Video Summarization","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-16T10:16:14.427680Z"},"links":{"citing_paper":"/paper/2504.18689"},"observation_digest":"sha256:27116c6b8f313911bcfa9ddd81ce12c75b0e739801f757864952145e60959a80","observation_id":"a59113d2-03b7-446b-9a7b-9f659d2c7045","resolution":{"observed_at":"2026-08-16T10:16:15.016599Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:16:14.992155Z","title":"Videobert: A joint model for video and language representation learning","venue":null,"work_id":"ab34719c-a201-4e9c-8f47-7659e045dbd2","year":2019},"citing_paper":{"arxiv_id":"2504.18689","last_updated":"2025-04-25T20:30:30Z","snapshot_observed_at":"2026-08-20T04:17:34.379426Z","submitted_at":"2025-04-25T20:30:30Z","title":"HierSum: A Global and Local Attention Mechanism for Video Summarization","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-16T10:16:14.432446Z"},"links":{"citing_paper":"/paper/2504.18689"},"observation_digest":"sha256:efaa84d8cc849b69c5dbd6c1092639f609691f6e3c388d3e5d6b22d484ad4910","observation_id":"f4b3f3d8-d94b-434a-b6c5-b90ff4e31093","resolution":{"observed_at":"2026-08-16T10:16:14.998341Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:16:14.438023Z","title":"Rethinking the inception archi- tecture for computer vision","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2504.18689","last_updated":"2025-04-25T20:30:30Z","snapshot_observed_at":"2026-08-20T04:17:34.379426Z","submitted_at":"2025-04-25T20:30:30Z","title":"HierSum: A Global and Local Attention Mechanism for Video Summarization","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-16T10:16:14.438023Z"},"links":{"citing_paper":"/paper/2504.18689"},"observation_digest":"sha256:d06f02d000eee8918d239c8040493d589e22310dd482b9f4f884b79be8709153","observation_id":"f2650f9a-91ed-4f3d-8d82-85396d1b9869","resolution":{"observed_at":"2026-08-16T10:16:14.438023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:16:14.960691Z","title":"Large model based sequential keyframe extrac- tion for video summarization, 2024","venue":null,"work_id":"7fb026b9-e3ae-48b5-9521-5ecfed05b4c1","year":2024},"citing_paper":{"arxiv_id":"2504.18689","last_updated":"2025-04-25T20:30:30Z","snapshot_observed_at":"2026-08-20T04:17:34.379426Z","submitted_at":"2025-04-25T20:30:30Z","title":"HierSum: A Global and Local Attention Mechanism for Video Summarization","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-16T10:16:14.444274Z"},"links":{"citing_paper":"/paper/2504.18689"},"observation_digest":"sha256:ced9cc4b7e78ee047f670e6360afbaab033181dcd6ca24ee140d0da9201a14fd","observation_id":"6e89edff-20ac-4359-a132-2457789e2003","resolution":{"observed_at":"2026-08-16T10:16:14.967469Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:16:14.449526Z","title":"Gomez, Lukasz Kaiser, and Illia Polosukhin","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.18689","last_updated":"2025-04-25T20:30:30Z","snapshot_observed_at":"2026-08-20T04:17:34.379426Z","submitted_at":"2025-04-25T20:30:30Z","title":"HierSum: A Global and Local Attention Mechanism for Video Summarization","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-16T10:16:14.449526Z"},"links":{"citing_paper":"/paper/2504.18689"},"observation_digest":"sha256:e52e8e9f652852b5bfa3a48e5412c12eef94fb3ba5fcce6b0d8c70f1ff0b0704","observation_id":"80c55e4d-37a0-48e2-98b7-ecac96c2a3e8","resolution":{"observed_at":"2026-08-16T10:16:14.449526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:16:15.570465Z","title":null,"venue":null,"work_id":"30dfe52f-821c-4268-ab13-a2d0f53b39c3","year":2019},"citing_paper":{"arxiv_id":"2504.18689","last_updated":"2025-04-25T20:30:30Z","snapshot_observed_at":"2026-08-20T04:17:34.379426Z","submitted_at":"2025-04-25T20:30:30Z","title":"HierSum: A Global and Local Attention Mechanism for Video Summarization","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-16T10:16:14.230779Z"},"links":{"citing_paper":"/paper/2504.18689"},"observation_digest":"sha256:dbd7baa75ba4520163ff194bd7af3e4e1666b435fcdabba1c281c17568acd1ea","observation_id":"2306820e-3ed0-45fb-a936-c884025c1f87","resolution":{"observed_at":"2026-08-16T10:16:15.575656Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:16:14.929571Z","title":"Intentvizor: Towards generic query guided interactive video summariza- tion","venue":null,"work_id":"b0b9bdd0-373a-4f04-b9a9-4e916e789791","year":null},"citing_paper":{"arxiv_id":"2504.18689","last_updated":"2025-04-25T20:30:30Z","snapshot_observed_at":"2026-08-20T04:17:34.379426Z","submitted_at":"2025-04-25T20:30:30Z","title":"HierSum: A Global and Local Attention Mechanism for Video Summarization","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-16T10:16:14.455122Z"},"links":{"citing_paper":"/paper/2504.18689"},"observation_digest":"sha256:e256c1e979b05bfa0edfb364c3b7c607a01f8c6cded7a0bb5d1b06bb42099995","observation_id":"439e67d8-a290-4f69-bfeb-003c1fbcfea8","resolution":{"observed_at":"2026-08-16T10:16:14.934967Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.08879","last_updated":"2024-12-16T03:16:59Z","snapshot_observed_at":"2026-08-13T01:37:11.297453Z","submitted_at":"2024-12-12T02:27:46Z","title":"Video Repurposing from User Generated Content: A Large-scale Dataset and Benchmark","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.08879","snapshot_observed_at":"2026-08-16T10:16:14.460830Z","title":"Video repurposing from user generated con- tent: A large-scale dataset and benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.18689","last_updated":"2025-04-25T20:30:30Z","snapshot_observed_at":"2026-08-20T04:17:34.379426Z","submitted_at":"2025-04-25T20:30:30Z","title":"HierSum: A Global and Local Attention Mechanism for Video Summarization","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-16T10:16:14.460830Z"},"links":{"cited_paper":"/paper/2412.08879","citing_paper":"/paper/2504.18689"},"observation_digest":"sha256:a26c8c118d6d48520fc7426332717c5ff54bea0b0ea3bfeade26d9a04e92e95b","observation_id":"dd44b3e3-1edc-4493-96e1-988247e8fae6","resolution":{"observed_at":"2026-08-16T10:16:14.460830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:16:14.907355Z","title":"Cross-category video high- light detection via set-based learning","venue":null,"work_id":"c831f084-28df-40f9-9ed5-00b4ef12ec50","year":2021},"citing_paper":{"arxiv_id":"2504.18689","last_updated":"2025-04-25T20:30:30Z","snapshot_observed_at":"2026-08-20T04:17:34.379426Z","submitted_at":"2025-04-25T20:30:30Z","title":"HierSum: A Global and Local Attention Mechanism for Video Summarization","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-16T10:16:14.466939Z"},"links":{"citing_paper":"/paper/2504.18689"},"observation_digest":"sha256:2b28789d1df56d2397e63902d785a6f45fa6e9023348f2a8e0f10c3bb1229a61","observation_id":"3fe71061-2306-423c-baa7-a8c8738adb60","resolution":{"observed_at":"2026-08-16T10:16:14.915573Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:16:14.890104Z","title":"Unloc: A unified framework for video localiza- tion tasks","venue":null,"work_id":"949fe2be-b143-4db3-a155-8d0386fb9b2c","year":2023},"citing_paper":{"arxiv_id":"2504.18689","last_updated":"2025-04-25T20:30:30Z","snapshot_observed_at":"2026-08-20T04:17:34.379426Z","submitted_at":"2025-04-25T20:30:30Z","title":"HierSum: A Global and Local Attention Mechanism for Video Summarization","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-16T10:16:14.472750Z"},"links":{"citing_paper":"/paper/2504.18689"},"observation_digest":"sha256:435ec350d07788e825dc7baed944c4f13d49cc11c0d70236cc23fd05e8725b5d","observation_id":"5a2f53df-1ed5-4a3f-b941-da10315a283a","resolution":{"observed_at":"2026-08-16T10:16:14.895180Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.13715","last_updated":"2022-07-23T10:19:12Z","snapshot_observed_at":"2026-08-16T18:06:46.000434Z","submitted_at":"2021-07-29T02:57:21Z","title":"Hierarchical Self-supervised Augmented Knowledge Distillation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.13715","snapshot_observed_at":"2026-08-16T10:16:14.477894Z","title":"Hierarchical self-supervised augmented knowledge dis- tillation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.18689","last_updated":"2025-04-25T20:30:30Z","snapshot_observed_at":"2026-08-20T04:17:34.379426Z","submitted_at":"2025-04-25T20:30:30Z","title":"HierSum: A Global and Local Attention Mechanism for Video Summarization","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-16T10:16:14.477894Z"},"links":{"cited_paper":"/paper/2107.13715","citing_paper":"/paper/2504.18689"},"observation_digest":"sha256:00a33e467ad194b4efc1d65de56556c08376e06da6170ff6188da6c20b8efbef","observation_id":"c1edf292-bc7e-49a3-8cec-4038bc97b3f7","resolution":{"observed_at":"2026-08-16T10:16:14.477894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:16:14.873720Z","title":"Bert representations for video question answering","venue":null,"work_id":"e3230d1c-191d-41ce-ae8c-7248a4cdf8ea","year":null},"citing_paper":{"arxiv_id":"2504.18689","last_updated":"2025-04-25T20:30:30Z","snapshot_observed_at":"2026-08-20T04:17:34.379426Z","submitted_at":"2025-04-25T20:30:30Z","title":"HierSum: A Global and Local Attention Mechanism for Video Summarization","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-16T10:16:14.483690Z"},"links":{"citing_paper":"/paper/2504.18689"},"observation_digest":"sha256:d4ae91a18a81482291f17552a32be9b6704c7187c26d9af9cf4b4f4c1c78a3a9","observation_id":"0e7beb73-249b-4296-82ad-06c6e8a42c7d","resolution":{"observed_at":"2026-08-16T10:16:14.878966Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:16:14.853759Z","title":"Hierarchical multi-modal video summariza- tion with dynamic sampling","venue":null,"work_id":"06c1b719-d479-4ea0-b6f1-0d296765584c","year":2024},"citing_paper":{"arxiv_id":"2504.18689","last_updated":"2025-04-25T20:30:30Z","snapshot_observed_at":"2026-08-20T04:17:34.379426Z","submitted_at":"2025-04-25T20:30:30Z","title":"HierSum: A Global and Local Attention Mechanism for Video Summarization","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-16T10:16:14.489225Z"},"links":{"citing_paper":"/paper/2504.18689"},"observation_digest":"sha256:f3f0610cf315ef0360278b07bc58d87e9d996977fdf53d49a660c6f4cc01a5de","observation_id":"802a5ce1-2ce8-4c89-8e45-7f87727c591a","resolution":{"observed_at":"2026-08-16T10:16:14.859738Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:16:14.494210Z","title":"Hierarchical video-moment retrieval and step-captioning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.18689","last_updated":"2025-04-25T20:30:30Z","snapshot_observed_at":"2026-08-20T04:17:34.379426Z","submitted_at":"2025-04-25T20:30:30Z","title":"HierSum: A Global and Local Attention Mechanism for Video Summarization","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-16T10:16:14.494210Z"},"links":{"citing_paper":"/paper/2504.18689"},"observation_digest":"sha256:bd995fae4a4563a7f9640d6f78af358549481c3e19a03a6847f8507bdf76fb56","observation_id":"abc407fe-0d94-47a8-9eac-ca7c3a2ffcbd","resolution":{"observed_at":"2026-08-16T10:16:14.494210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:16:14.819250Z","title":"Hsa-rnn: Hier- archical structure-adaptive rnn for video summarization","venue":null,"work_id":"1b21d73e-16ca-4786-a0b5-5b933cf1ae37","year":2018},"citing_paper":{"arxiv_id":"2504.18689","last_updated":"2025-04-25T20:30:30Z","snapshot_observed_at":"2026-08-20T04:17:34.379426Z","submitted_at":"2025-04-25T20:30:30Z","title":"HierSum: A Global and Local Attention Mechanism for Video Summarization","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-16T10:16:14.498926Z"},"links":{"citing_paper":"/paper/2504.18689"},"observation_digest":"sha256:a3e630f8f459096afa3c12275b5ab7bdc58fd90d26a1c48c1ca4ca3f2160df33","observation_id":"9efa830c-6c4c-4e7d-8ee5-a81477e7fdfa","resolution":{"observed_at":"2026-08-16T10:16:14.827105Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:16:14.794888Z","title":"Deep reinforce- ment learning for unsupervised video summarization with diversity-representativeness reward","venue":null,"work_id":"afe15ed4-4959-4b6b-8c3b-fb8513aad6fe","year":2018},"citing_paper":{"arxiv_id":"2504.18689","last_updated":"2025-04-25T20:30:30Z","snapshot_observed_at":"2026-08-20T04:17:34.379426Z","submitted_at":"2025-04-25T20:30:30Z","title":"HierSum: A Global and Local Attention Mechanism for Video Summarization","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-16T10:16:14.504482Z"},"links":{"citing_paper":"/paper/2504.18689"},"observation_digest":"sha256:b2a221d25b323d38eabeff43b7f86974f7e07d5bc88ce71a4a963ff2954d4863","observation_id":"aeeb4520-1f37-4810-a338-cfcbf2e8b0f5","resolution":{"observed_at":"2026-08-16T10:16:14.801488Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:16:14.774764Z","title":"Dsnet: A flexible detect-to-summarize network for video summariza- tion","venue":null,"work_id":"f685e594-eaac-46c3-94fd-717796902c0b","year":null},"citing_paper":{"arxiv_id":"2504.18689","last_updated":"2025-04-25T20:30:30Z","snapshot_observed_at":"2026-08-20T04:17:34.379426Z","submitted_at":"2025-04-25T20:30:30Z","title":"HierSum: A Global and Local Attention Mechanism for Video Summarization","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-16T10:16:14.511623Z"},"links":{"citing_paper":"/paper/2504.18689"},"observation_digest":"sha256:37bafb094cb77a3dfa2054edcabb29d482d79d4dfa9dcac3610a74b875e0eb41","observation_id":"fc81cd8b-403d-4caa-a6d0-d438edc1db40","resolution":{"observed_at":"2026-08-16T10:16:14.782140Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2504.18689","last_updated":"2025-04-25T20:30:30Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-20T04:17:34.379426Z","submitted_at":"2025-04-25T20:30:30Z","title":"HierSum: A Global and Local Attention Mechanism for Video Summarization"},"reference_resolution":{"displayed":65,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":21,"verified_exact":1,"verified_fuzzy":42},"total_outbound_references":65},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 65 of 65 outbound references and 0 inbound Pith citation observations for arXiv:2504.18689."}