Pith. sign in

Paper Citation Record · LEDGER

Towards an Automated Multimodal Approach for Video Summarization: Building a Bridge Between Text, Audio and Facial Cue-Based Summarization

As of 17 August 2026, this Paper Citation Record lists 36 of 36 outbound references and 0 inbound Pith citation observations for arXiv:2506.23714.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2506.23714 v1

Coverage vector

measured 36 of 36 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-06T21:38:45.547295Z

measured 36 of 36 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-17T06:30:58.91139+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

36 of 36 outbound references displayed

  • verified exact2
  • verified fuzzy16
  • unresolved18
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 1c8d0ab6-eabf-45ec-ba85-c2c154aa2a93 · outbound

This paper cites Apostolidis, E.

Towards an Automated Multimodal Approach for Video Summarization: Building a Bridge Between Text, Audio and Facial Cue-Based Summarization Apostolidis, E

Reference 1

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:38:51.946959Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-06T21:38:41.726899Z digest=sha256:2f79c5c045def0e4f832b00e2790847960bef979d035c37deca78de55da65b9c

Observation 2eb97bf5-b907-4c40-9252-8890bcc32079 · outbound

This paper cites an unresolved cited work.

Towards an Automated Multimodal Approach for Video Summarization: Building a Bridge Between Text, Audio and Facial Cue-Based Summarization Unresolved cited work

Reference 2

Resolution
unresolved
raw_fallback, observed 2026-08-06T21:38:51.675229Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-06T21:38:41.843334Z digest=sha256:5b88224b2f66128d6247dda318330d0ad30b05928c9e1893ea60460a2165ae90

Observation a9d4485a-7722-4d00-85f7-da7d4868509a · outbound

This paper cites Tiwari, C.

Towards an Automated Multimodal Approach for Video Summarization: Building a Bridge Between Text, Audio and Facial Cue-Based Summarization Tiwari, C

Reference 3

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:38:51.479100Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-06T21:38:41.927525Z digest=sha256:2d4c717e57a8576abb5fc7eb2138c044ee1468fa7af5a20906036aa9e97b590a

Observation 381d26d5-de0e-4068-917a-b53ec001a0dc · outbound

This paper cites Otani, Y.

Towards an Automated Multimodal Approach for Video Summarization: Building a Bridge Between Text, Audio and Facial Cue-Based Summarization Otani, Y

Reference 4

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:38:51.283393Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-06T21:38:42.019442Z digest=sha256:72386e82f08e986d274f8120578900d5d2146ab6bad382ebea4d72941ad535b1

Observation cbc56d9b-5ee8-48fc-8314-4b61e76cd7bd · outbound

This paper cites Rochan, L.

Towards an Automated Multimodal Approach for Video Summarization: Building a Bridge Between Text, Audio and Facial Cue-Based Summarization Rochan, L

Reference 5

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:38:51.086223Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-06T21:38:42.083343Z digest=sha256:4cc4534906ede39365998d540be0b9be450b2fc9be4aa3476facb43bd064641a

Observation 961b9393-b0aa-4f4b-9f6b-1dc8cdf10302 · outbound

This paper cites an unresolved cited work.

Towards an Automated Multimodal Approach for Video Summarization: Building a Bridge Between Text, Audio and Facial Cue-Based Summarization Unresolved cited work

Reference 6

Resolution
unresolved
raw_fallback, observed 2026-08-06T21:38:50.835567Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-06T21:38:42.160765Z digest=sha256:33cad2e728dd49fd5098e6eccbb3bcf99b98c1243b5dde6c76b3f2c4c153fb65

Observation 0c249360-1a60-4e4d-8517-c8cd63ef52e5 · outbound

This paper cites an unresolved cited work.

Towards an Automated Multimodal Approach for Video Summarization: Building a Bridge Between Text, Audio and Facial Cue-Based Summarization Unresolved cited work

Reference 7

Resolution
unresolved
raw_fallback, observed 2026-08-06T21:38:50.613929Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-06T21:38:42.271990Z digest=sha256:a5d07d14d4d32e7cc1ef1dff6b1d81115204677d6c79bc6a86aea6cb06c7ce4a

Observation f5e1c958-ed12-4208-b7d2-94f2b619d2b5 · outbound

This paper cites an unresolved cited work.

Towards an Automated Multimodal Approach for Video Summarization: Building a Bridge Between Text, Audio and Facial Cue-Based Summarization Unresolved cited work

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-06T21:38:42.386654Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T21:38:42.386654Z digest=sha256:9d7f16fab23cb2b1413504341e7f47cae58c5d829e9ad45a84d03f64a28156b1

Observation 2c3d545d-d505-4b1e-9333-520bc826e5bb · outbound

This paper cites Get To The Point: Summarization with Pointer-Generator Networks.

Towards an Automated Multimodal Approach for Video Summarization: Building a Bridge Between Text, Audio and Facial Cue-Based Summarization Get To The Point: Summarization with Pointer-Generator Networks

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-06T21:38:42.501169Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T21:38:42.501169Z digest=sha256:d4a950ded84f9645f352965c614017feff00bff8bb818623ba0327c259f18836

Observation 0d9b036c-f9b5-483c-886a-d230ec05a78b · outbound

This paper cites an unresolved cited work.

Towards an Automated Multimodal Approach for Video Summarization: Building a Bridge Between Text, Audio and Facial Cue-Based Summarization Unresolved cited work

Reference 10

Resolution
unresolved
raw_fallback, observed 2026-08-06T21:38:50.445452Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-06T21:38:42.593261Z digest=sha256:74ffb5bbcc2bf814c4bdb2112dd2cf1047bf4e7ab203ab975ce7de8480ffff1e

Observation a207b5fe-3468-416a-982f-cee44c9e27ea · outbound

This paper cites an unresolved cited work.

Towards an Automated Multimodal Approach for Video Summarization: Building a Bridge Between Text, Audio and Facial Cue-Based Summarization Unresolved cited work

Reference 11

Resolution
unresolved
raw_fallback, observed 2026-08-06T21:38:50.194173Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-06T21:38:42.792890Z digest=sha256:93c9255b81f5f5c1dde348e75088917b52391bb22148548a0b7014f7f4c3b339

Observation a72f83fe-2201-4393-bfcd-80fed780a55d · outbound

This paper cites an unresolved cited work.

Towards an Automated Multimodal Approach for Video Summarization: Building a Bridge Between Text, Audio and Facial Cue-Based Summarization Unresolved cited work

Reference 12

Resolution
unresolved
raw_fallback, observed 2026-08-06T21:38:50.036229Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-06T21:38:42.831226Z digest=sha256:19c7308da5b6ba502e53f77facf84f4a797735e5672d4d99c5517a99f8afd597

Observation c798f581-c284-4204-adee-12e3d0c0733a · outbound

This paper cites an unresolved cited work.

Towards an Automated Multimodal Approach for Video Summarization: Building a Bridge Between Text, Audio and Facial Cue-Based Summarization Unresolved cited work

Reference 13

Resolution
unresolved
raw_fallback, observed 2026-08-06T21:38:49.782366Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-06T21:38:42.910882Z digest=sha256:5a96eab1af49df6f479346454f4901541218b8783ba4a965a7e7578b86a56368

Observation 5a0af3e5-a26c-4430-9d5a-89f6a6ffd8f0 · outbound

This paper cites Zhang, W.-L.

Towards an Automated Multimodal Approach for Video Summarization: Building a Bridge Between Text, Audio and Facial Cue-Based Summarization Zhang, W.-L

Reference 14

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:38:49.528283Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-06T21:38:43.006112Z digest=sha256:d12f48ecbedd41bd704fcd82b54bf572c2cf3159c1f9d5611230d8ac2957b761

Observation 62b27317-ba1b-4d54-8481-cb8ebca2c983 · outbound

This paper cites Saini, K.

Towards an Automated Multimodal Approach for Video Summarization: Building a Bridge Between Text, Audio and Facial Cue-Based Summarization Saini, K

Reference 15

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:38:49.287084Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-06T21:38:43.118186Z digest=sha256:32b150923d535b6d63cff5008e7b598e288449c3f1d56fcb41769935239d6e17

Observation 886df382-a896-4c47-9f4c-2b180d455ba8 · outbound

This paper cites Evangelopoulos, A.

Towards an Automated Multimodal Approach for Video Summarization: Building a Bridge Between Text, Audio and Facial Cue-Based Summarization Evangelopoulos, A

Reference 16

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:38:49.078689Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-06T21:38:43.213503Z digest=sha256:55249e490991a7cf04380ad73b3863015b7a923492dca9693a8a073f9fbd04c1

Observation fb2656d3-fa37-472f-b2af-f9f51d9aa4df · outbound

This paper cites Multimodal Frame-Scoring Transformer for Video Summarization.

Towards an Automated Multimodal Approach for Video Summarization: Building a Bridge Between Text, Audio and Facial Cue-Based Summarization Multimodal Frame-Scoring Transformer for Video Summarization

Reference 17

Resolution
verified exact
local_arxiv, observed 2026-08-06T21:38:45.965102Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-06T21:38:43.276662Z digest=sha256:11033cf296acf0a41c748a9f67cf926f87c2d13cbd9e97526a475af992daecda

Observation d39ed602-c3d9-42ff-bcc5-f0bda509258b · outbound

This paper cites an unresolved cited work.

Towards an Automated Multimodal Approach for Video Summarization: Building a Bridge Between Text, Audio and Facial Cue-Based Summarization Unresolved cited work

Reference 18

Resolution
unresolved
raw_fallback, observed 2026-08-06T21:38:48.856571Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-06T21:38:43.444350Z digest=sha256:1e4954fef261e9b8fb9b7086196b73a28b477ef68a0cd34b9a4f8747e1961536

Observation b1503f76-54af-49d9-b4d3-70b0802bf9d5 · outbound

This paper cites an unresolved cited work.

Towards an Automated Multimodal Approach for Video Summarization: Building a Bridge Between Text, Audio and Facial Cue-Based Summarization Unresolved cited work

Reference 19

Resolution
unresolved
raw_fallback, observed 2026-08-06T21:38:48.607542Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-06T21:38:43.569978Z digest=sha256:bc328d5e12df65790db7e590749d4fd9719d31a4b2cf60a2bbffbb122b592f96

Observation a9f653a7-cd91-4f50-9d39-55e416539141 · outbound

This paper cites Psallidas, P.

Towards an Automated Multimodal Approach for Video Summarization: Building a Bridge Between Text, Audio and Facial Cue-Based Summarization Psallidas, P

Reference 20

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:38:48.323566Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-06T21:38:43.730639Z digest=sha256:ceea1f8e2c81f796fe143650f2743c5434834ad57be05c86501fd919fd8b07d4

Observation cbc3dd90-8b34-4a14-ac97-60f9b3d3be1a · outbound

This paper cites an unresolved cited work.

Towards an Automated Multimodal Approach for Video Summarization: Building a Bridge Between Text, Audio and Facial Cue-Based Summarization Unresolved cited work

Reference 21

Resolution
unresolved
raw_fallback, observed 2026-08-06T21:38:48.174758Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-06T21:38:43.802627Z digest=sha256:3be843ff9f59e57552693a9c4c9d8fb00b1f8c7ae9bbc5afcdffa7c1d339f260

Observation 144dfa5c-f4b8-4c54-a3bf-1e44247daee2 · outbound

This paper cites an unresolved cited work.

Towards an Automated Multimodal Approach for Video Summarization: Building a Bridge Between Text, Audio and Facial Cue-Based Summarization Unresolved cited work

Reference 22

Resolution
unresolved
raw_fallback, observed 2026-08-06T21:38:48.054461Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-06T21:38:43.934293Z digest=sha256:21017963d4b5b1a8cc97e018aefce3880e891caa327772db392cd5a3ef8d663c

Observation 8c7936bb-aefd-439f-97de-1c0c8bb55e04 · outbound

This paper cites an unresolved cited work.

Towards an Automated Multimodal Approach for Video Summarization: Building a Bridge Between Text, Audio and Facial Cue-Based Summarization Unresolved cited work

Reference 23

Resolution
unresolved
raw_fallback, observed 2026-08-06T21:38:47.918043Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-06T21:38:44.117750Z digest=sha256:9298b7aad49768c6578f57652d01cb3b7d28b4acb5566ad0a01018cca735228b

Observation e6bc727e-9258-4621-9e86-eb581face9c4 · outbound

This paper cites Ponce-López, B.

Towards an Automated Multimodal Approach for Video Summarization: Building a Bridge Between Text, Audio and Facial Cue-Based Summarization Ponce-López, B

Reference 24

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:38:47.765723Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-06T21:38:44.274131Z digest=sha256:c637293a873d2a59b9bb9dda88816c645770a0b9bbc06fc0dbad809da2303c8a

Observation 454caf69-4c5d-4748-8eef-257f5696f746 · outbound

This paper cites Robust Speech Recognition via Large-Scale Weak Supervision.

Towards an Automated Multimodal Approach for Video Summarization: Building a Bridge Between Text, Audio and Facial Cue-Based Summarization Robust Speech Recognition via Large-Scale Weak Supervision

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-06T21:38:44.378445Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T21:38:44.378445Z digest=sha256:162cd1d9b057270d147681c7f247130ecb75369566894320cebd36d6348ac59f

Observation 40129d1c-c0d4-4d33-a40f-6d5796b06ee4 · outbound

This paper cites Honnibal, I.

Towards an Automated Multimodal Approach for Video Summarization: Building a Bridge Between Text, Audio and Facial Cue-Based Summarization Honnibal, I

Reference 26

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:38:47.609541Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-06T21:38:44.467892Z digest=sha256:ad57962da9b51aa97e2510ac9f2ed4e1cb00bd4469998a646c085933af8262aa

Observation 15ad8d3d-7527-4caa-b676-3655989e9ea0 · outbound

This paper cites McAuliffe, M.

Towards an Automated Multimodal Approach for Video Summarization: Building a Bridge Between Text, Audio and Facial Cue-Based Summarization McAuliffe, M

Reference 27

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:38:47.442804Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-06T21:38:44.581457Z digest=sha256:db2ba35ff844d06631ab65cb297198382a78bf0997176ea2fb1e289229138918

Observation 2b019d12-fe56-4340-aa0d-f2d290cdfe2a · outbound

This paper cites Bradski, The opencv library., Dr.

Towards an Automated Multimodal Approach for Video Summarization: Building a Bridge Between Text, Audio and Facial Cue-Based Summarization Bradski, The opencv library., Dr

Reference 28

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:38:47.182495Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-06T21:38:44.656403Z digest=sha256:41c4b40e6f5fa91853fe5eee3a65c671a6b7354e99115cb3e952eb80ff403a17

Observation bdce2f8c-fb21-465d-a7e6-e7799bf975fc · outbound

This paper cites MediaPipe: A Framework for Building Perception Pipelines.

Towards an Automated Multimodal Approach for Video Summarization: Building a Bridge Between Text, Audio and Facial Cue-Based Summarization MediaPipe: A Framework for Building Perception Pipelines

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-06T21:38:44.780495Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T21:38:44.780495Z digest=sha256:5aa2ce1a791eff1bd6b5cf685a97fe50194d6da8911f38aa032b2aabc8b19798

Observation 5c5b0eb6-fc0a-4835-9f06-09b9bbe92be0 · outbound

This paper cites Serengil, A.

Towards an Automated Multimodal Approach for Video Summarization: Building a Bridge Between Text, Audio and Facial Cue-Based Summarization Serengil, A

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-06T21:38:44.868440Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T21:38:44.868440Z digest=sha256:59a3c3845e264cbb4a5dcb26cfa2d19aaf765f2c6429126ad9e5c06d3baa0bd7

Observation 5bc15467-43d0-45ed-b8e9-6b5c2583ff94 · outbound

This paper cites Kasi, Yet another algorithm for pitch tracking (yaapt), 2002.

Towards an Automated Multimodal Approach for Video Summarization: Building a Bridge Between Text, Audio and Facial Cue-Based Summarization Kasi, Yet another algorithm for pitch tracking (yaapt), 2002

Reference 31

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:38:46.996042Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-06T21:38:45.019358Z digest=sha256:dcb235493e5345fecbce43f6da18ee836cc3db6e677080a145914039f5791ed1

Observation 65596910-48c2-42f9-aad3-7f074369f7c3 · outbound

This paper cites Eyben, M.

Towards an Automated Multimodal Approach for Video Summarization: Building a Bridge Between Text, Audio and Facial Cue-Based Summarization Eyben, M

Reference 32

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:38:46.771570Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-06T21:38:45.121470Z digest=sha256:63d91ff80ed798531d4f0bc27c0b80d690228983f1a12d29981d430825d2d3f1

Observation a4398015-e2c8-4dc7-b105-5bb6393f2704 · outbound

This paper cites Sparck Jones, A statistical interpretation of term specificity and its application in retrieval, Journal of documentation 28 (1972) 11–21.

Towards an Automated Multimodal Approach for Video Summarization: Building a Bridge Between Text, Audio and Facial Cue-Based Summarization Sparck Jones, A statistical interpretation of term specificity and its application in retrieval, Journal of documentation 28 (1972) 11–21

Reference 33

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:38:46.554911Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-06T21:38:45.264167Z digest=sha256:aa8bda6d79fd508484382c225099d7638bbace8a707cc76a9ae67a893aec1965

Observation 8296f4a2-12d4-42c6-89b9-ca931e52cdeb · outbound

This paper cites an unresolved cited work.

Towards an Automated Multimodal Approach for Video Summarization: Building a Bridge Between Text, Audio and Facial Cue-Based Summarization Unresolved cited work

Reference 34

Resolution
unresolved
raw_fallback, observed 2026-08-06T21:38:46.397336Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-06T21:38:45.362663Z digest=sha256:514d7336095975ff179be6d1fd69199a086c26180628670ba13262981da1b06e

Observation a69251c5-26de-4f6c-b9ca-fa59d31aa6b9 · outbound

This paper cites Scaling Up Video Summarization Pretraining with Large Language Models.

Towards an Automated Multimodal Approach for Video Summarization: Building a Bridge Between Text, Audio and Facial Cue-Based Summarization Scaling Up Video Summarization Pretraining with Large Language Models

Reference 35

Resolution
verified exact
local_arxiv, observed 2026-08-06T21:38:45.783605Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-06T21:38:45.460292Z digest=sha256:bf6fb90af687d1f7806d85600a4e7531e26b87f9b18ff7129f6ab263c40cf158

Observation d4c6b550-d87d-4990-bc63-c22d7e5f54d0 · outbound

This paper cites Narasimhan, A.

Towards an Automated Multimodal Approach for Video Summarization: Building a Bridge Between Text, Audio and Facial Cue-Based Summarization Narasimhan, A

Reference 36

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:38:46.223123Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-06T21:38:45.547295Z digest=sha256:472f1bfffdd59bf1b49c45cb0863430cb6b3793e8713ded1ec888c91d43afb2b

Pith citing papers

No inbound Pith citation observations are available.