{"as_of":"2026-08-10T13:52:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:fe1935d3bd4703efb73b35eff13b1183beabc521212b38e4b22418979136ac97","coverage":[{"denominator":36,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":36,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T21:38:45.547295Z","state":"measured"},{"denominator":36,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":36,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.23714/citation-record","integrity":"/paper/2506.23714/integrity","json":"/paper/2506.23714/citation-record.json","paper":"/paper/2506.23714"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:38:51.762835Z","title":"Apostolidis, E","venue":null,"work_id":"8a16a04f-4b27-4d7b-b227-5de8894ea1d1","year":2021},"citing_paper":{"arxiv_id":"2506.23714","last_updated":"2025-06-30T10:41:33Z","snapshot_observed_at":"2026-08-08T16:30:17.795530Z","submitted_at":"2025-06-30T10:41:33Z","title":"Towards an Automated Multimodal Approach for Video Summarization: Building a Bridge Between Text, Audio and Facial Cue-Based Summarization","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T21:38:41.726899Z"},"links":{"citing_paper":"/paper/2506.23714"},"observation_digest":"sha256:e97754104ca51251b06d24d27de4701144dfa3a7e74d1b2a6ffad07e9fe3e668","observation_id":"1c8d0ab6-eabf-45ec-ba85-c2c154aa2a93","resolution":{"observed_at":"2026-08-06T21:38:51.946959Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:38:51.568443Z","title":null,"venue":null,"work_id":"8f264246-9243-4d3d-a50d-32a3f751f5e6","year":2015},"citing_paper":{"arxiv_id":"2506.23714","last_updated":"2025-06-30T10:41:33Z","snapshot_observed_at":"2026-08-08T16:30:17.795530Z","submitted_at":"2025-06-30T10:41:33Z","title":"Towards an Automated Multimodal Approach for Video Summarization: Building a Bridge Between Text, Audio and Facial Cue-Based Summarization","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T21:38:41.843334Z"},"links":{"citing_paper":"/paper/2506.23714"},"observation_digest":"sha256:11007a82de694174aecd28a22d0f4cc9e2653b5c7586308b276787ab086363e9","observation_id":"2eb97bf5-b907-4c40-9252-8890bcc32079","resolution":{"observed_at":"2026-08-06T21:38:51.675229Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:38:51.379651Z","title":"Tiwari, C","venue":null,"work_id":"c033170d-c157-4074-94a2-42f0e7b49dc3","year":2021},"citing_paper":{"arxiv_id":"2506.23714","last_updated":"2025-06-30T10:41:33Z","snapshot_observed_at":"2026-08-08T16:30:17.795530Z","submitted_at":"2025-06-30T10:41:33Z","title":"Towards an Automated Multimodal Approach for Video Summarization: Building a Bridge Between Text, Audio and Facial Cue-Based Summarization","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T21:38:41.927525Z"},"links":{"citing_paper":"/paper/2506.23714"},"observation_digest":"sha256:d214f224d11d26f4b6f1c8a44a5f4710d9e7ecb830ea2bea08313d632ba5da48","observation_id":"a9d4485a-7722-4d00-85f7-da7d4868509a","resolution":{"observed_at":"2026-08-06T21:38:51.479100Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:38:51.193806Z","title":"Otani, Y","venue":null,"work_id":"f2e2ed00-5a78-490a-85ba-57efd4a85882","year":2016},"citing_paper":{"arxiv_id":"2506.23714","last_updated":"2025-06-30T10:41:33Z","snapshot_observed_at":"2026-08-08T16:30:17.795530Z","submitted_at":"2025-06-30T10:41:33Z","title":"Towards an Automated Multimodal Approach for Video Summarization: Building a Bridge Between Text, Audio and Facial Cue-Based Summarization","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T21:38:42.019442Z"},"links":{"citing_paper":"/paper/2506.23714"},"observation_digest":"sha256:7d3a089611921ecd62642dafb6576a58395dcb305a09b0857ec3a3466135e292","observation_id":"381d26d5-de0e-4068-917a-b53ec001a0dc","resolution":{"observed_at":"2026-08-06T21:38:51.283393Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:38:50.969756Z","title":"Rochan, L","venue":null,"work_id":"5c2d6fa2-7bbb-41b8-985a-150dc4c538c8","year":2018},"citing_paper":{"arxiv_id":"2506.23714","last_updated":"2025-06-30T10:41:33Z","snapshot_observed_at":"2026-08-08T16:30:17.795530Z","submitted_at":"2025-06-30T10:41:33Z","title":"Towards an Automated Multimodal Approach for Video Summarization: Building a Bridge Between Text, Audio and Facial Cue-Based Summarization","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T21:38:42.083343Z"},"links":{"citing_paper":"/paper/2506.23714"},"observation_digest":"sha256:3eb87b5da5322972bf1d82531aa66457d307d368596db283435465ee0573baa3","observation_id":"cbc56d9b-5ee8-48fc-8314-4b61e76cd7bd","resolution":{"observed_at":"2026-08-06T21:38:51.086223Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:38:50.718228Z","title":null,"venue":null,"work_id":"9c23720a-694a-49a1-86bd-6cb2ee1e32eb","year":2024},"citing_paper":{"arxiv_id":"2506.23714","last_updated":"2025-06-30T10:41:33Z","snapshot_observed_at":"2026-08-08T16:30:17.795530Z","submitted_at":"2025-06-30T10:41:33Z","title":"Towards an Automated Multimodal Approach for Video Summarization: Building a Bridge Between Text, Audio and Facial Cue-Based Summarization","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T21:38:42.160765Z"},"links":{"citing_paper":"/paper/2506.23714"},"observation_digest":"sha256:fad691994c045650cab5313915d6a09e8506d7b7beca03bad4ba4cc52db8246e","observation_id":"961b9393-b0aa-4f4b-9f6b-1dc8cdf10302","resolution":{"observed_at":"2026-08-06T21:38:50.835567Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:38:50.550229Z","title":null,"venue":null,"work_id":"7b3cac82-7c8b-4a70-aa08-37961fb7246c","year":1969},"citing_paper":{"arxiv_id":"2506.23714","last_updated":"2025-06-30T10:41:33Z","snapshot_observed_at":"2026-08-08T16:30:17.795530Z","submitted_at":"2025-06-30T10:41:33Z","title":"Towards an Automated Multimodal Approach for Video Summarization: Building a Bridge Between Text, Audio and Facial Cue-Based Summarization","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T21:38:42.271990Z"},"links":{"citing_paper":"/paper/2506.23714"},"observation_digest":"sha256:5796f694295109abcdb24ec12258bd55bdde3b104b41d052c5da75c717f0eed3","observation_id":"0c249360-1a60-4e4d-8517-c8cd63ef52e5","resolution":{"observed_at":"2026-08-06T21:38:50.613929Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:38:42.386654Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23714","last_updated":"2025-06-30T10:41:33Z","snapshot_observed_at":"2026-08-08T16:30:17.795530Z","submitted_at":"2025-06-30T10:41:33Z","title":"Towards an Automated Multimodal Approach for Video Summarization: Building a Bridge Between Text, Audio and Facial Cue-Based Summarization","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T21:38:42.386654Z"},"links":{"citing_paper":"/paper/2506.23714"},"observation_digest":"sha256:fd1d33526a306b925ac0e975a3528838f7144e6ab0e0744a82ea4cf84d400890","observation_id":"f5e1c958-ed12-4208-b7d2-94f2b619d2b5","resolution":{"observed_at":"2026-08-06T21:38:42.386654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1704.04368","last_updated":"2017-04-25T05:47:50Z","snapshot_observed_at":"2026-07-06T05:37:49.239583Z","submitted_at":"2017-04-14T07:55:19Z","title":"Get To The Point: Summarization with Pointer-Generator Networks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1704.04368","snapshot_observed_at":"2026-08-06T21:38:42.501169Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.23714","last_updated":"2025-06-30T10:41:33Z","snapshot_observed_at":"2026-08-08T16:30:17.795530Z","submitted_at":"2025-06-30T10:41:33Z","title":"Towards an Automated Multimodal Approach for Video Summarization: Building a Bridge Between Text, Audio and Facial Cue-Based Summarization","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T21:38:42.501169Z"},"links":{"cited_paper":"/paper/1704.04368","citing_paper":"/paper/2506.23714"},"observation_digest":"sha256:51abd44b9e5ae2bd334809dca3cc6668f70cd1e0894c3eebb3c28ceca411169e","observation_id":"2c3d545d-d505-4b1e-9333-520bc826e5bb","resolution":{"observed_at":"2026-08-06T21:38:42.501169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:38:50.282137Z","title":null,"venue":null,"work_id":"432d1f16-33a9-4ea3-8658-877b955c33f2","year":2018},"citing_paper":{"arxiv_id":"2506.23714","last_updated":"2025-06-30T10:41:33Z","snapshot_observed_at":"2026-08-08T16:30:17.795530Z","submitted_at":"2025-06-30T10:41:33Z","title":"Towards an Automated Multimodal Approach for Video Summarization: Building a Bridge Between Text, Audio and Facial Cue-Based Summarization","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T21:38:42.593261Z"},"links":{"citing_paper":"/paper/2506.23714"},"observation_digest":"sha256:5caff948bf38bbbb47c8abc2af7cc7bd312a9df1591e61c6767fa61382a46a78","observation_id":"0d9b036c-f9b5-483c-886a-d230ec05a78b","resolution":{"observed_at":"2026-08-06T21:38:50.445452Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:38:50.107720Z","title":null,"venue":null,"work_id":"c36acdfe-07dd-4e13-beb1-56946166429e","year":2022},"citing_paper":{"arxiv_id":"2506.23714","last_updated":"2025-06-30T10:41:33Z","snapshot_observed_at":"2026-08-08T16:30:17.795530Z","submitted_at":"2025-06-30T10:41:33Z","title":"Towards an Automated Multimodal Approach for Video Summarization: Building a Bridge Between Text, Audio and Facial Cue-Based Summarization","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T21:38:42.792890Z"},"links":{"citing_paper":"/paper/2506.23714"},"observation_digest":"sha256:4e761af2ac1eb327024a5ead7b3ee44f6615d45ee39426b1b2776e8915efa99a","observation_id":"a207b5fe-3468-416a-982f-cee44c9e27ea","resolution":{"observed_at":"2026-08-06T21:38:50.194173Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:38:49.903756Z","title":null,"venue":null,"work_id":"67856450-6f7e-4449-b1ee-5a7be18471ea","year":2021},"citing_paper":{"arxiv_id":"2506.23714","last_updated":"2025-06-30T10:41:33Z","snapshot_observed_at":"2026-08-08T16:30:17.795530Z","submitted_at":"2025-06-30T10:41:33Z","title":"Towards an Automated Multimodal Approach for Video Summarization: Building a Bridge Between Text, Audio and Facial Cue-Based Summarization","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T21:38:42.831226Z"},"links":{"citing_paper":"/paper/2506.23714"},"observation_digest":"sha256:21989dd09973bcf53a082030442232ada8bf0fa1589cc36c7a79ef7f39be07c0","observation_id":"a72f83fe-2201-4393-bfcd-80fed780a55d","resolution":{"observed_at":"2026-08-06T21:38:50.036229Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:38:49.650891Z","title":null,"venue":null,"work_id":"0e7222bc-4635-459c-9c52-774b648d34bb","year":2024},"citing_paper":{"arxiv_id":"2506.23714","last_updated":"2025-06-30T10:41:33Z","snapshot_observed_at":"2026-08-08T16:30:17.795530Z","submitted_at":"2025-06-30T10:41:33Z","title":"Towards an Automated Multimodal Approach for Video Summarization: Building a Bridge Between Text, Audio and Facial Cue-Based Summarization","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T21:38:42.910882Z"},"links":{"citing_paper":"/paper/2506.23714"},"observation_digest":"sha256:b4f638b660bebf184ac9c12fce754596805e633f7fdd1975763f42c0ecb439c2","observation_id":"c798f581-c284-4204-adee-12e3d0c0733a","resolution":{"observed_at":"2026-08-06T21:38:49.782366Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:38:49.407502Z","title":"Zhang, W.-L","venue":null,"work_id":"0bd4d80a-62ac-4467-8b3f-eb238a17c698","year":2016},"citing_paper":{"arxiv_id":"2506.23714","last_updated":"2025-06-30T10:41:33Z","snapshot_observed_at":"2026-08-08T16:30:17.795530Z","submitted_at":"2025-06-30T10:41:33Z","title":"Towards an Automated Multimodal Approach for Video Summarization: Building a Bridge Between Text, Audio and Facial Cue-Based Summarization","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T21:38:43.006112Z"},"links":{"citing_paper":"/paper/2506.23714"},"observation_digest":"sha256:9b8c73cdd0908901e48903dea10ad05565ea9539293abc8222d7b4ded8bb550a","observation_id":"5a0af3e5-a26c-4430-9d5a-89f6a6ffd8f0","resolution":{"observed_at":"2026-08-06T21:38:49.528283Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:38:49.165706Z","title":"Saini, K","venue":null,"work_id":"15e48646-9a2f-4a5b-a598-92c65f17fb52","year":2023},"citing_paper":{"arxiv_id":"2506.23714","last_updated":"2025-06-30T10:41:33Z","snapshot_observed_at":"2026-08-08T16:30:17.795530Z","submitted_at":"2025-06-30T10:41:33Z","title":"Towards an Automated Multimodal Approach for Video Summarization: Building a Bridge Between Text, Audio and Facial Cue-Based Summarization","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T21:38:43.118186Z"},"links":{"citing_paper":"/paper/2506.23714"},"observation_digest":"sha256:6cb3fccac53a674bf2c48331dd61ec5347d6caa39a4dc2c9e2984c123c5fed43","observation_id":"62b27317-ba1b-4d54-8481-cb8ebca2c983","resolution":{"observed_at":"2026-08-06T21:38:49.287084Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:38:48.975185Z","title":"Evangelopoulos, A","venue":null,"work_id":"ead247cb-7a11-44fd-90d8-397a6eb17ae2","year":2013},"citing_paper":{"arxiv_id":"2506.23714","last_updated":"2025-06-30T10:41:33Z","snapshot_observed_at":"2026-08-08T16:30:17.795530Z","submitted_at":"2025-06-30T10:41:33Z","title":"Towards an Automated Multimodal Approach for Video Summarization: Building a Bridge Between Text, Audio and Facial Cue-Based Summarization","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T21:38:43.213503Z"},"links":{"citing_paper":"/paper/2506.23714"},"observation_digest":"sha256:1408948d5a17fb4be054f4a8329b9da6c660682a6253077d4a3977af3776f73a","observation_id":"886df382-a896-4c47-9f4c-2b180d455ba8","resolution":{"observed_at":"2026-08-06T21:38:49.078689Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.01814","last_updated":"2023-01-20T00:18:49Z","snapshot_observed_at":"2026-07-06T13:27:49.894090Z","submitted_at":"2022-07-05T05:14:15Z","title":"Multimodal Frame-Scoring Transformer for Video Summarization","version":3},"cited_work":{"arxiv_id":"2207.01814","doi":null,"metadata_source":"pith","pith_arxiv_id":"2207.01814","snapshot_observed_at":"2026-08-06T21:38:45.877367Z","title":"Multimodal Frame-Scoring Transformer for Video Summarization","venue":"cs.LG","work_id":"89846e4e-851c-4086-83bb-6b239cd03eba","year":2022},"citing_paper":{"arxiv_id":"2506.23714","last_updated":"2025-06-30T10:41:33Z","snapshot_observed_at":"2026-08-08T16:30:17.795530Z","submitted_at":"2025-06-30T10:41:33Z","title":"Towards an Automated Multimodal Approach for Video Summarization: Building a Bridge Between Text, Audio and Facial Cue-Based Summarization","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T21:38:43.276662Z"},"links":{"cited_paper":"/paper/2207.01814","citing_paper":"/paper/2506.23714"},"observation_digest":"sha256:62d2f94842c90abdc637be612202b16267b5ffcba8c0fd8f3fd9927d08ac7555","observation_id":"fb2656d3-fa37-472f-b2af-f9f51d9aa4df","resolution":{"observed_at":"2026-08-06T21:38:45.965102Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:38:48.718814Z","title":null,"venue":null,"work_id":"249151a9-fc72-4dc6-93a3-6abcf0bed3b7","year":2021},"citing_paper":{"arxiv_id":"2506.23714","last_updated":"2025-06-30T10:41:33Z","snapshot_observed_at":"2026-08-08T16:30:17.795530Z","submitted_at":"2025-06-30T10:41:33Z","title":"Towards an Automated Multimodal Approach for Video Summarization: Building a Bridge Between Text, Audio and Facial Cue-Based Summarization","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T21:38:43.444350Z"},"links":{"citing_paper":"/paper/2506.23714"},"observation_digest":"sha256:e67600182ea242e75096659af4f6c19a52302400cdaba0d60ebbf9c0c0e8c6fb","observation_id":"d39ed602-c3d9-42ff-bcc5-f0bda509258b","resolution":{"observed_at":"2026-08-06T21:38:48.856571Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:38:48.455106Z","title":null,"venue":null,"work_id":"0a90c9e8-6cc3-4660-a988-58e1f1fd3b3a","year":2022},"citing_paper":{"arxiv_id":"2506.23714","last_updated":"2025-06-30T10:41:33Z","snapshot_observed_at":"2026-08-08T16:30:17.795530Z","submitted_at":"2025-06-30T10:41:33Z","title":"Towards an Automated Multimodal Approach for Video Summarization: Building a Bridge Between Text, Audio and Facial Cue-Based Summarization","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T21:38:43.569978Z"},"links":{"citing_paper":"/paper/2506.23714"},"observation_digest":"sha256:d3a0ee3f91f5d7afa7b020f2de79b30128ea727d3d4f404d220bec3c5dae5dfa","observation_id":"b1503f76-54af-49d9-b4d3-70b0802bf9d5","resolution":{"observed_at":"2026-08-06T21:38:48.607542Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:38:48.242787Z","title":"Psallidas, P","venue":null,"work_id":"ac6d0b2b-091a-4f22-9e54-c5e70d3322d3","year":2021},"citing_paper":{"arxiv_id":"2506.23714","last_updated":"2025-06-30T10:41:33Z","snapshot_observed_at":"2026-08-08T16:30:17.795530Z","submitted_at":"2025-06-30T10:41:33Z","title":"Towards an Automated Multimodal Approach for Video Summarization: Building a Bridge Between Text, Audio and Facial Cue-Based Summarization","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T21:38:43.730639Z"},"links":{"citing_paper":"/paper/2506.23714"},"observation_digest":"sha256:fd7cc970a24d80c4af9d1777ad2945589d0e84808a2a615c180ac01b0ccbf400","observation_id":"a9f653a7-cd91-4f50-9d39-55e416539141","resolution":{"observed_at":"2026-08-06T21:38:48.323566Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:38:48.123598Z","title":null,"venue":null,"work_id":"93e0ae5c-1a70-4e20-b23b-458ba846247a","year":2023},"citing_paper":{"arxiv_id":"2506.23714","last_updated":"2025-06-30T10:41:33Z","snapshot_observed_at":"2026-08-08T16:30:17.795530Z","submitted_at":"2025-06-30T10:41:33Z","title":"Towards an Automated Multimodal Approach for Video Summarization: Building a Bridge Between Text, Audio and Facial Cue-Based Summarization","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T21:38:43.802627Z"},"links":{"citing_paper":"/paper/2506.23714"},"observation_digest":"sha256:193091a835ed7179e1ec8a827e6d139036633a15b17c1ffd680a260956c011ec","observation_id":"cbc3dd90-8b34-4a14-ac97-60f9b3d3be1a","resolution":{"observed_at":"2026-08-06T21:38:48.174758Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:38:47.985935Z","title":null,"venue":null,"work_id":"0e33f641-e6f5-4102-b8e2-ea6637325c48","year":2024},"citing_paper":{"arxiv_id":"2506.23714","last_updated":"2025-06-30T10:41:33Z","snapshot_observed_at":"2026-08-08T16:30:17.795530Z","submitted_at":"2025-06-30T10:41:33Z","title":"Towards an Automated Multimodal Approach for Video Summarization: Building a Bridge Between Text, Audio and Facial Cue-Based Summarization","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T21:38:43.934293Z"},"links":{"citing_paper":"/paper/2506.23714"},"observation_digest":"sha256:23ff312f08217cf02cb64768450a44e3a7c4d1089dddc7465c692e14fefb70b8","observation_id":"144dfa5c-f4b8-4c54-a3bf-1e44247daee2","resolution":{"observed_at":"2026-08-06T21:38:48.054461Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:38:47.825739Z","title":null,"venue":null,"work_id":"01241bc2-189d-4b1e-876b-5927bb89f4c5","year":2022},"citing_paper":{"arxiv_id":"2506.23714","last_updated":"2025-06-30T10:41:33Z","snapshot_observed_at":"2026-08-08T16:30:17.795530Z","submitted_at":"2025-06-30T10:41:33Z","title":"Towards an Automated Multimodal Approach for Video Summarization: Building a Bridge Between Text, Audio and Facial Cue-Based Summarization","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T21:38:44.117750Z"},"links":{"citing_paper":"/paper/2506.23714"},"observation_digest":"sha256:65a8fe0d1ec45c834bb140d14415f22c7e2da400dcb7a64d3561901c6250821b","observation_id":"8c7936bb-aefd-439f-97de-1c0c8bb55e04","resolution":{"observed_at":"2026-08-06T21:38:47.918043Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:38:47.688196Z","title":"Ponce-López, B","venue":null,"work_id":"595e1cc2-7de9-4f85-bf67-556cae959dfb","year":2016},"citing_paper":{"arxiv_id":"2506.23714","last_updated":"2025-06-30T10:41:33Z","snapshot_observed_at":"2026-08-08T16:30:17.795530Z","submitted_at":"2025-06-30T10:41:33Z","title":"Towards an Automated Multimodal Approach for Video Summarization: Building a Bridge Between Text, Audio and Facial Cue-Based Summarization","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T21:38:44.274131Z"},"links":{"citing_paper":"/paper/2506.23714"},"observation_digest":"sha256:e8c56b8c41211f7afd6ac0cee221959a83fec71e5b993592ee0757a531419445","observation_id":"e6bc727e-9258-4621-9e86-eb581face9c4","resolution":{"observed_at":"2026-08-06T21:38:47.765723Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-06T21:38:44.378445Z","title":"Radford, J","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.23714","last_updated":"2025-06-30T10:41:33Z","snapshot_observed_at":"2026-08-08T16:30:17.795530Z","submitted_at":"2025-06-30T10:41:33Z","title":"Towards an Automated Multimodal Approach for Video Summarization: Building a Bridge Between Text, Audio and Facial Cue-Based Summarization","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T21:38:44.378445Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2506.23714"},"observation_digest":"sha256:da476e99771b8fdf029d70cabd16b1be3d2b9d47e0a9859ad92fefd92648577d","observation_id":"454caf69-4c5d-4748-8eef-257f5696f746","resolution":{"observed_at":"2026-08-06T21:38:44.378445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:38:47.555620Z","title":"Honnibal, I","venue":null,"work_id":"afd3cf67-d338-4199-85bc-8a15f3231d03","year":2020},"citing_paper":{"arxiv_id":"2506.23714","last_updated":"2025-06-30T10:41:33Z","snapshot_observed_at":"2026-08-08T16:30:17.795530Z","submitted_at":"2025-06-30T10:41:33Z","title":"Towards an Automated Multimodal Approach for Video Summarization: Building a Bridge Between Text, Audio and Facial Cue-Based Summarization","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T21:38:44.467892Z"},"links":{"citing_paper":"/paper/2506.23714"},"observation_digest":"sha256:ed94d96daacaeb84ef5ef321a88e3ff69d0f26b7547389a5a1ce1d8c52585a2d","observation_id":"40129d1c-c0d4-4d33-a40f-6d5796b06ee4","resolution":{"observed_at":"2026-08-06T21:38:47.609541Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:38:47.327863Z","title":"McAuliffe, M","venue":null,"work_id":"d59cb080-ebe8-42ff-93cc-683695962308","year":2017},"citing_paper":{"arxiv_id":"2506.23714","last_updated":"2025-06-30T10:41:33Z","snapshot_observed_at":"2026-08-08T16:30:17.795530Z","submitted_at":"2025-06-30T10:41:33Z","title":"Towards an Automated Multimodal Approach for Video Summarization: Building a Bridge Between Text, Audio and Facial Cue-Based Summarization","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T21:38:44.581457Z"},"links":{"citing_paper":"/paper/2506.23714"},"observation_digest":"sha256:06214e0ba37ed50f261547573b543eab1e256899454be7295b30e2e784d55881","observation_id":"15ad8d3d-7527-4caa-b676-3655989e9ea0","resolution":{"observed_at":"2026-08-06T21:38:47.442804Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:38:47.123757Z","title":"Bradski, The opencv library., Dr","venue":null,"work_id":"6b6eb528-fe8e-468c-812b-9f96c90d062c","year":2000},"citing_paper":{"arxiv_id":"2506.23714","last_updated":"2025-06-30T10:41:33Z","snapshot_observed_at":"2026-08-08T16:30:17.795530Z","submitted_at":"2025-06-30T10:41:33Z","title":"Towards an Automated Multimodal Approach for Video Summarization: Building a Bridge Between Text, Audio and Facial Cue-Based Summarization","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T21:38:44.656403Z"},"links":{"citing_paper":"/paper/2506.23714"},"observation_digest":"sha256:bdebb2836464dc755cdb397808a054d921250ce55554c98ccbfa36501ae807bb","observation_id":"2b019d12-fe56-4340-aa0d-f2d290cdfe2a","resolution":{"observed_at":"2026-08-06T21:38:47.182495Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1906.08172","last_updated":"2019-06-14T05:49:22Z","snapshot_observed_at":"2026-08-05T19:15:35.517082Z","submitted_at":"2019-06-14T05:49:22Z","title":"MediaPipe: A Framework for Building Perception Pipelines","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.08172","snapshot_observed_at":"2026-08-06T21:38:44.780495Z","title":"Lugaresi, J","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.23714","last_updated":"2025-06-30T10:41:33Z","snapshot_observed_at":"2026-08-08T16:30:17.795530Z","submitted_at":"2025-06-30T10:41:33Z","title":"Towards an Automated Multimodal Approach for Video Summarization: Building a Bridge Between Text, Audio and Facial Cue-Based Summarization","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T21:38:44.780495Z"},"links":{"cited_paper":"/paper/1906.08172","citing_paper":"/paper/2506.23714"},"observation_digest":"sha256:52ec2755dd1fe24acf7ba10e3e1bca2b7abfe32106196adc55fd3556463e1dfb","observation_id":"bdce2f8c-fb21-465d-a7e6-e7799bf975fc","resolution":{"observed_at":"2026-08-06T21:38:44.780495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:38:44.868440Z","title":"Serengil, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23714","last_updated":"2025-06-30T10:41:33Z","snapshot_observed_at":"2026-08-08T16:30:17.795530Z","submitted_at":"2025-06-30T10:41:33Z","title":"Towards an Automated Multimodal Approach for Video Summarization: Building a Bridge Between Text, Audio and Facial Cue-Based Summarization","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T21:38:44.868440Z"},"links":{"citing_paper":"/paper/2506.23714"},"observation_digest":"sha256:9873a9ccdbbf3929cc528320cae7473121798096e6a3cc1d8f6e1856cce8b1e2","observation_id":"5c5b0eb6-fc0a-4835-9f06-09b9bbe92be0","resolution":{"observed_at":"2026-08-06T21:38:44.868440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:38:46.866484Z","title":"Kasi, Yet another algorithm for pitch tracking (yaapt), 2002","venue":null,"work_id":"c1ce862b-cc60-4966-876b-c42b41f1d9c7","year":2002},"citing_paper":{"arxiv_id":"2506.23714","last_updated":"2025-06-30T10:41:33Z","snapshot_observed_at":"2026-08-08T16:30:17.795530Z","submitted_at":"2025-06-30T10:41:33Z","title":"Towards an Automated Multimodal Approach for Video Summarization: Building a Bridge Between Text, Audio and Facial Cue-Based Summarization","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T21:38:45.019358Z"},"links":{"citing_paper":"/paper/2506.23714"},"observation_digest":"sha256:504d02767431fb51ae4aa5fb9661eed2e6def820ddd66f64a7920cf64877da73","observation_id":"5bc15467-43d0-45ed-b8e9-6b5c2583ff94","resolution":{"observed_at":"2026-08-06T21:38:46.996042Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:38:46.673256Z","title":"Eyben, M","venue":null,"work_id":"c37bd1a6-811c-49c1-a261-47072dbe517b","year":2010},"citing_paper":{"arxiv_id":"2506.23714","last_updated":"2025-06-30T10:41:33Z","snapshot_observed_at":"2026-08-08T16:30:17.795530Z","submitted_at":"2025-06-30T10:41:33Z","title":"Towards an Automated Multimodal Approach for Video Summarization: Building a Bridge Between Text, Audio and Facial Cue-Based Summarization","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T21:38:45.121470Z"},"links":{"citing_paper":"/paper/2506.23714"},"observation_digest":"sha256:25f614180df602a4aebfc1849a40b08e59de74bdf28e494559a03d4c4c355eda","observation_id":"65596910-48c2-42f9-aad3-7f074369f7c3","resolution":{"observed_at":"2026-08-06T21:38:46.771570Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:38:46.494801Z","title":"Sparck Jones, A statistical interpretation of term specificity and its application in retrieval, Journal of documentation 28 (1972) 11–21","venue":null,"work_id":"a98a7123-1766-4635-895b-30f56648d2f4","year":1972},"citing_paper":{"arxiv_id":"2506.23714","last_updated":"2025-06-30T10:41:33Z","snapshot_observed_at":"2026-08-08T16:30:17.795530Z","submitted_at":"2025-06-30T10:41:33Z","title":"Towards an Automated Multimodal Approach for Video Summarization: Building a Bridge Between Text, Audio and Facial Cue-Based Summarization","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T21:38:45.264167Z"},"links":{"citing_paper":"/paper/2506.23714"},"observation_digest":"sha256:7194e3c2d5880419f46bdd298f8fdc1e67bb1c88c8a56e750d6bc019e8491beb","observation_id":"a4398015-e2c8-4dc7-b105-5bb6393f2704","resolution":{"observed_at":"2026-08-06T21:38:46.554911Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:38:46.304900Z","title":null,"venue":null,"work_id":"7b5d5de4-2737-492e-8115-9a3dd70b47cb","year":2016},"citing_paper":{"arxiv_id":"2506.23714","last_updated":"2025-06-30T10:41:33Z","snapshot_observed_at":"2026-08-08T16:30:17.795530Z","submitted_at":"2025-06-30T10:41:33Z","title":"Towards an Automated Multimodal Approach for Video Summarization: Building a Bridge Between Text, Audio and Facial Cue-Based Summarization","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T21:38:45.362663Z"},"links":{"citing_paper":"/paper/2506.23714"},"observation_digest":"sha256:03a05dd6a71354db6aa4be4430fa8828be32de74180962222d8f26681589293e","observation_id":"8296f4a2-12d4-42c6-89b9-ca931e52cdeb","resolution":{"observed_at":"2026-08-06T21:38:46.397336Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.03398","last_updated":"2024-04-04T11:59:06Z","snapshot_observed_at":"2026-08-09T02:31:58.801139Z","submitted_at":"2024-04-04T11:59:06Z","title":"Scaling Up Video Summarization Pretraining with Large Language Models","version":1},"cited_work":{"arxiv_id":"2404.03398","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.03398","snapshot_observed_at":"2026-08-06T21:38:45.665208Z","title":"Scaling Up Video Summarization Pretraining with Large Language Models","venue":"cs.CV","work_id":"3145fbb7-238c-4f4a-904d-c2cb2b8ad046","year":2024},"citing_paper":{"arxiv_id":"2506.23714","last_updated":"2025-06-30T10:41:33Z","snapshot_observed_at":"2026-08-08T16:30:17.795530Z","submitted_at":"2025-06-30T10:41:33Z","title":"Towards an Automated Multimodal Approach for Video Summarization: Building a Bridge Between Text, Audio and Facial Cue-Based Summarization","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T21:38:45.460292Z"},"links":{"cited_paper":"/paper/2404.03398","citing_paper":"/paper/2506.23714"},"observation_digest":"sha256:1d6f72ed47da11a0b268b2362455fddba6b7cec45ed8bca259e0b3f7f641f840","observation_id":"a69251c5-26de-4f6c-b9ca-fa59d31aa6b9","resolution":{"observed_at":"2026-08-06T21:38:45.783605Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:38:46.151550Z","title":"Narasimhan, A","venue":null,"work_id":"0ed81853-d5a0-4781-a4b3-3b6ecd41befc","year":2022},"citing_paper":{"arxiv_id":"2506.23714","last_updated":"2025-06-30T10:41:33Z","snapshot_observed_at":"2026-08-08T16:30:17.795530Z","submitted_at":"2025-06-30T10:41:33Z","title":"Towards an Automated Multimodal Approach for Video Summarization: Building a Bridge Between Text, Audio and Facial Cue-Based Summarization","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T21:38:45.547295Z"},"links":{"citing_paper":"/paper/2506.23714"},"observation_digest":"sha256:1386f239c4465e83df0bf41baf7e3c1d746573f4d7e6fe03ddc6063a79952d91","observation_id":"d4c6b550-d87d-4990-bc63-c22d7e5f54d0","resolution":{"observed_at":"2026-08-06T21:38:46.223123Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.23714","last_updated":"2025-06-30T10:41:33Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T16:30:17.795530Z","submitted_at":"2025-06-30T10:41:33Z","title":"Towards an Automated Multimodal Approach for Video Summarization: Building a Bridge Between Text, Audio and Facial Cue-Based Summarization"},"reference_resolution":{"displayed":36,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":18,"verified_exact":2,"verified_fuzzy":16},"total_outbound_references":36},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 36 of 36 outbound references and 0 inbound Pith citation observations for arXiv:2506.23714."}