Pith. sign in

Paper Citation Record · LEDGER

Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model

As of 20 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 1 inbound Pith citation observation for arXiv:2505.13062.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2505.13062 v3

Coverage vector

measured 41 of 41 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-15T20:25:31.105122Z

measured 42 of 42 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-20T06:33:59.587034+00:00

measured 1 of 1 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-15T20:25:30.954743Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: pith, observed 2026-08-15T20:25:31.298438Z

Reference resolution

41 of 41 outbound references displayed

  • verified exact0
  • verified fuzzy16
  • unresolved23
  • parse uncertain0
  • malformed identifier1
  • metadata mismatch1

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 4ea2c479-b15d-413c-acd7-527324f5090a · outbound

This paper cites Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model.

Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model

Reference 1

Resolution
metadata mismatch
local_arxiv, observed 2026-08-15T20:25:31.304236Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-15T20:25:30.954743Z digest=sha256:d2da952939334c45df263d92419e76ad166d05e843fb064822ddac8b25704d87

Observation f5731167-1c17-4eed-965a-c55997dc66e0 · outbound

This paper cites SFT for SV AD Given a silent video V = I T t=1 withT frames, the SV AD task aims to generate a corresponding audio descriptionCaudio.

Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model SFT for SV AD Given a silent video V = I T t=1 withT frames, the SV AD task aims to generate a corresponding audio descriptionCaudio

Reference 2

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:25:31.521636Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-15T20:25:30.963218Z digest=sha256:65cd9c22c06eb7cbe480d79e60dd3b3dd5f7b0a65c652fc88df69644ea04a206

Observation eaed0417-0dd9-4561-86bf-b27b85b69929 · outbound

This paper cites an unresolved cited work.

Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model Unresolved cited work

Reference 3

Resolution
malformed identifier
raw_fallback, observed 2026-08-15T20:25:31.510788Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-15T20:25:30.967354Z digest=sha256:9d9d08adb7621f02890b932988fa52a0dceeb869939212cd4490adfd4bb95090

Observation b1f99f45-1435-4309-ad95-58a9ab79dc68 · outbound

This paper cites an unresolved cited work.

Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model Unresolved cited work

Reference 4

Resolution
unresolved
raw_fallback, observed 2026-08-15T20:25:31.500577Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-15T20:25:30.971335Z digest=sha256:47503f98f87eed0be0c1f32f7382f0a5b6ca6772772269ec7523474319bba2f8

Observation 284182dc-e2cc-4900-a2d2-3ec29bfd01a3 · outbound

This paper cites MiniGPT4-Video: Advancing Multimodal LLMs for Video Understanding with Interleaved Visual-Textual Tokens.

Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model MiniGPT4-Video: Advancing Multimodal LLMs for Video Understanding with Interleaved Visual-Textual Tokens

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-15T20:25:30.990915Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:25:30.990915Z digest=sha256:c0582ee86caa3649c3173dd37146d7f272d36d6419f5e65588c76648e0ac8d0d

Observation 1ce585bf-1cbd-46e4-8dea-10197763c2d2 · outbound

This paper cites Multisensory- guided associative learning enhances multisensory representation in primary auditory cortex,.

Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model Multisensory- guided associative learning enhances multisensory representation in primary auditory cortex,

Reference 6

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:25:31.489915Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-15T20:25:30.974975Z digest=sha256:b018576505d9522c9edfda438fa8e7e6b59fa61fe7f9e9b46f8f6d6cafb83c7b

Observation 77e07d20-e03f-49b3-88ca-f220eee99961 · outbound

This paper cites MM-LLMs: Recent Advances in MultiModal Large Language Models.

Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model MM-LLMs: Recent Advances in MultiModal Large Language Models

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-15T20:25:30.978656Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:25:30.978656Z digest=sha256:730c71c1ab786cf6b7fd0dceb014967fd4bf0dd64ce223cf9fcd5e9a0a727fea

Observation 362b949f-dad6-4244-a3b8-c006b8b180b2 · outbound

This paper cites VideoChat: Chat-Centric Video Understanding.

Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model VideoChat: Chat-Centric Video Understanding

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-15T20:25:30.982484Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:25:30.982484Z digest=sha256:2d9276f4ff5966cd980a11f2930ed77a67da2b2d82af2a3b20b2477eed8844b0

Observation 2196f4a7-e8cf-44d3-8da0-5a3c6c9a569c · outbound

This paper cites Video-LLaVA: Learning United Visual Representation by Alignment Before Projection.

Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model Video-LLaVA: Learning United Visual Representation by Alignment Before Projection

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-15T20:25:30.986800Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:25:30.986800Z digest=sha256:8ed46965fd95e83af8a7ba8fa9c990a6d098c0a1b22aea859cd6799908cef3fc

Observation 4c19d327-59f8-4445-8d81-db6b18681e49 · outbound

This paper cites STA-V2A: Video-to-Audio Generation with Semantic and Temporal Alignment.

Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model STA-V2A: Video-to-Audio Generation with Semantic and Temporal Alignment

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-15T20:25:31.011778Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:25:31.011778Z digest=sha256:3cd21d99f490385ac2bcbe60ab2f95db73c675ae05242d8d3da5a13fba2c8f12

Observation 9ae3ddbc-b652-4a76-839e-9901d10ec1b6 · outbound

This paper cites Video-to-Audio Generation with Hidden Alignment.

Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model Video-to-Audio Generation with Hidden Alignment

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-15T20:25:30.995667Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:25:30.995667Z digest=sha256:a396ecffb9ddd6f2d75aa1804607475539443943537519e82f0b76ee313fea96

Observation f15cd0ab-403f-4041-baad-11197ebdf900 · outbound

This paper cites Frieren: Efficient Video-to-Audio Generation Network with Rectified Flow Matching.

Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model Frieren: Efficient Video-to-Audio Generation Network with Rectified Flow Matching

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-15T20:25:30.999910Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:25:30.999910Z digest=sha256:54137301a2166cc5a230395f82f2f025ec9f3e8f3445325a6c6d49b4cacca81c

Observation 44878e4b-545a-41f0-a16e-fceac3f57f41 · outbound

This paper cites V2a- mapper: A lightweight solution for vision-to-audio generation by connecting foundation models,.

Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model V2a- mapper: A lightweight solution for vision-to-audio generation by connecting foundation models,

Reference 13

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:25:31.478939Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-15T20:25:31.004061Z digest=sha256:6e538c4bcd2ae9bcb61e45e780b19f2eb48d8a6d9e015bfefc1b61a8b7d27515

Observation feace7b4-450d-4946-b42d-21e6045664e0 · outbound

This paper cites Foleygen: Visually-guided audio generation,.

Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model Foleygen: Visually-guided audio generation,

Reference 14

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:25:31.468363Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-15T20:25:31.007650Z digest=sha256:59b11737f8613815ba1c786d33fbfc745534739e945d0f8385d22df44ab5f232

Observation 18472efb-57f1-4f3f-b574-bca98d354bf9 · outbound

This paper cites Wavcaps: A chatgpt-assisted weakly- labelled audio captioning dataset for audio-language multimodal research,.

Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model Wavcaps: A chatgpt-assisted weakly- labelled audio captioning dataset for audio-language multimodal research,

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-15T20:25:31.030495Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:25:31.030495Z digest=sha256:9e7a7d219b1954e69f61d4f51565ff3f465fc82ad3dea3c014def7b4e4c1e1af

Observation 25a35509-3055-4ad8-a498-f9160489027d · outbound

This paper cites Text-to-Audio Generation Synchronized with Videos.

Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model Text-to-Audio Generation Synchronized with Videos

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-15T20:25:31.015693Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:25:31.015693Z digest=sha256:7f7a17b8185eb718b37ebeda5d022e5d7a81683262c724509cda6b0e3832b9e6

Observation 8fb3c112-9498-4a3f-b0fe-a785e763ebd2 · outbound

This paper cites FoleyCrafter: Bring Silent Videos to Life with Lifelike and Synchronized Sounds.

Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model FoleyCrafter: Bring Silent Videos to Life with Lifelike and Synchronized Sounds

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-15T20:25:31.019247Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:25:31.019247Z digest=sha256:ccaf615841917dd60737974e263229d0cceba4d9059dd64274e8cd5c9198cf2f

Observation a03c0787-f0c9-4648-ac43-3779aea4f037 · outbound

This paper cites Read, Watch and Scream! Sound Generation from Text and Video.

Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model Read, Watch and Scream! Sound Generation from Text and Video

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-15T20:25:31.022815Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:25:31.022815Z digest=sha256:94dadc3b699e9cdd08fa70f393c073e59b831a12ef4020630cb5076b7558434c

Observation f584c6a1-2a11-49c5-8f75-1f9adfd55165 · outbound

This paper cites FolAI: Synchronized Foley Sound Generation with Semantic and Temporal Alignment.

Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model FolAI: Synchronized Foley Sound Generation with Semantic and Temporal Alignment

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-15T20:25:31.026317Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:25:31.026317Z digest=sha256:c145d65842a4311f156becc79b213ecbc39f8b1be590474c5ea839c59ae6057b

Observation 92e1dd92-2121-47ad-9bc6-fa069eb0e06c · outbound

This paper cites LAVCap: LLM-based Audio-Visual Captioning using Optimal Transport.

Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model LAVCap: LLM-based Audio-Visual Captioning using Optimal Transport

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-15T20:25:31.048189Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:25:31.048189Z digest=sha256:d08901f10500ca6fb65a102b0e21014cc8a821eb614d0d20ea58f224c73a151f

Observation 7707387e-fe86-4ddf-82f1-7b08dc136b3c · outbound

This paper cites Conette: An efficient au- dio captioning system leveraging multiple datasets with task em- bedding,.

Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model Conette: An efficient au- dio captioning system leveraging multiple datasets with task em- bedding,

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-15T20:25:31.033984Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:25:31.033984Z digest=sha256:26422edc7fc8dcda8b7e960ffa956edbd3cf17c5b6e4ea67b24c0b72b0ea87c9

Observation 678a54ef-0ac2-4661-a5e2-11c78754244a · outbound

This paper cites Automatic video captioning using tree hierarchical deep convolutional neu- ral network and asrnn-bi-directional lstm,.

Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model Automatic video captioning using tree hierarchical deep convolutional neu- ral network and asrnn-bi-directional lstm,

Reference 22

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:25:31.445167Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-15T20:25:31.037314Z digest=sha256:3c4b04696fe8568ba1750a10b36ebcad98f34b229331dcbff499483eb53718e2

Observation dbbae53a-3ae4-421f-9fee-05f82fe597b7 · outbound

This paper cites Streaming dense video captioning,.

Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model Streaming dense video captioning,

Reference 23

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:25:31.434478Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-15T20:25:31.040976Z digest=sha256:8f1da6ec6e9371450ad741b6c269be2d2231a93b6f7ec8b05068a18af0c90f3d

Observation d77a8053-30e2-4f0f-a42a-4f421eb3052c · outbound

This paper cites AVCap: Leveraging Audio-Visual Features as Text Tokens for Captioning.

Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model AVCap: Leveraging Audio-Visual Features as Text Tokens for Captioning

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-15T20:25:31.044527Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:25:31.044527Z digest=sha256:072723c144c0b7fd1b6659779ec9f150b92faf0f9d2ba2359653bc6418e76374

Observation 82eef265-2b49-4bf9-bda8-ddcdf46e4150 · outbound

This paper cites LoRA: Low-Rank Adaptation of Large Language Models,.

Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model LoRA: Low-Rank Adaptation of Large Language Models,

Reference 25

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:25:31.403181Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-15T20:25:31.066625Z digest=sha256:8fca16e163a642fb5f2777c97b8113a0465c9e69bd10d6ff95f8356de35ec379

Observation dd4e23ca-97e8-42fd-9630-4ff4ae785269 · outbound

This paper cites an unresolved cited work.

Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model Unresolved cited work

Reference 26

Resolution
unresolved
raw_fallback, observed 2026-08-15T20:25:31.531676Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-15T20:25:30.959376Z digest=sha256:97d9ba890d5569dc43c3bb4f02327307bde85b82244f0a0f5c6c5ec63e0221db

Observation 74fa0396-0ea8-4937-835c-55415ff7c5d2 · outbound

This paper cites An eye for an ear: zero-shot audio description leveraging an image captioner with audio-visual token distribution matching,.

Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model An eye for an ear: zero-shot audio description leveraging an image captioner with audio-visual token distribution matching,

Reference 27

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:25:31.424081Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-15T20:25:31.051720Z digest=sha256:349eac86f55b7f4ad6476adce530438b54e1e4bf4f1381be5a9609da405dc9cb

Observation 9b4b0f06-7b50-45f8-89ba-2a35155a16aa · outbound

This paper cites VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs.

Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-15T20:25:31.055296Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:25:31.055296Z digest=sha256:594d846524437d1aaf02d0c637fc699dd3d24aed8a2abf23f1bbc1595b19c1de

Observation 85d49c75-0db9-4a8b-a2c5-6836a03b46f8 · outbound

This paper cites Oryx MLLM: On-Demand Spatial-Temporal Understanding at Arbitrary Resolution.

Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model Oryx MLLM: On-Demand Spatial-Temporal Understanding at Arbitrary Resolution

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-15T20:25:31.059117Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:25:31.059117Z digest=sha256:f19ff4523d5ee5ed145bee2dce844ab31a0063de68aa46aaca9592939dff1457

Observation 243a8b76-21f5-40d4-8d5f-b7a273d96fda · outbound

This paper cites Internvl: Scaling up vision foun- dation models and aligning for generic visual-linguistic tasks,.

Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model Internvl: Scaling up vision foun- dation models and aligning for generic visual-linguistic tasks,

Reference 30

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:25:31.413892Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-15T20:25:31.063165Z digest=sha256:ca46c677f0b1fda3516f4960b1f0e0e5feeb5177a5b759777443198285976973

Observation 37f408ac-3dd9-45af-b12c-26f66d1d4934 · outbound

This paper cites Chain-of-thought prompting elicits reasoning in large language models,.

Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model Chain-of-thought prompting elicits reasoning in large language models,

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-15T20:25:31.070010Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:25:31.070010Z digest=sha256:17a8cca76aa3b2106c8d7cdb7f249722c3a7f472434c2a94e8f29741c6bbc871

Observation bd2efa4d-726f-4c0b-8bd7-2e9e2e40e59f · outbound

This paper cites Audiocaps: Generat- ing captions for audios in the wild,.

Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model Audiocaps: Generat- ing captions for audios in the wild,

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-15T20:25:31.073254Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:25:31.073254Z digest=sha256:5706c8abf96ae774d09cbd7461e514e7beacc168db7e1061b78fadcf7d9cd967

Observation a8375c5c-9baf-456c-9441-576008fcf55d · outbound

This paper cites GPT-4o System Card.

Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model GPT-4o System Card

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-15T20:25:31.076500Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:25:31.076500Z digest=sha256:7982b1b96549bbe937f9ec0a59ea107bc8be8b9ca60c264555c69c57863b5fe0

Observation 98e3f8bc-e07e-4d65-96e2-5a71e5504bab · outbound

This paper cites Large-scale contrastive language-audio pretraining with feature fusion and keyword-to-caption augmentation,.

Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model Large-scale contrastive language-audio pretraining with feature fusion and keyword-to-caption augmentation,

Reference 34

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:25:31.380074Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-15T20:25:31.079772Z digest=sha256:dbe7dca45251cf01db4dafc625340b252f775219263f0433c9a884a42c135add

Observation e4209607-048a-4018-8810-7e9937d9f066 · outbound

This paper cites Bleu: a method for automatic evaluation of machine translation,.

Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model Bleu: a method for automatic evaluation of machine translation,

Reference 35

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:25:31.369004Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-15T20:25:31.083009Z digest=sha256:e2720068a0c7a662c08b5d8fa57b61a7839456c14feb2305034999c62c06cb43

Observation ca474cb5-5e15-4d39-8400-74b900f0eab9 · outbound

This paper cites Meteor: An automatic metric for mt evaluation with improved correlation with human judgments,.

Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model Meteor: An automatic metric for mt evaluation with improved correlation with human judgments,

Reference 36

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:25:31.357837Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-15T20:25:31.086629Z digest=sha256:e4db7d7d3fc633c0fdc0af930c80a061f288f042d595d98f3b9f42ed7dcfa523

Observation c7563e6a-e57e-4d09-988a-1600ab5f93cf · outbound

This paper cites Rouge: A package for automatic evaluation of sum- maries,.

Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model Rouge: A package for automatic evaluation of sum- maries,

Reference 37

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:25:31.346844Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-15T20:25:31.089834Z digest=sha256:3cc0276f4491e9f3b58fdb97be4466f29c58187f6d7fcbc0e601160a5045f2bd

Observation c4be74c4-4337-4175-8cf9-e9c46ee7b2af · outbound

This paper cites Cider: Consensus-based image description evaluation,.

Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model Cider: Consensus-based image description evaluation,

Reference 38

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:25:31.336845Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-15T20:25:31.093343Z digest=sha256:7a24946ae7d8934a258be06b354b6fcecafd78db35be6d426275e51828563aea

Observation 0a9bf1a8-5169-4aa7-8c10-824cf5de2467 · outbound

This paper cites Spice: Se- mantic propositional image caption evaluation,.

Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model Spice: Se- mantic propositional image caption evaluation,

Reference 39

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:25:31.326264Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-15T20:25:31.097455Z digest=sha256:8779a01bb5cfe9b627f51abee42131f0f856f61edbaa88994c7512a971a17b87

Observation b3fb4b55-5c87-4e36-b638-651ffbeb94f6 · outbound

This paper cites Diverse and aligned audio-to-video generation via text-to-video model adaptation,.

Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model Diverse and aligned audio-to-video generation via text-to-video model adaptation,

Reference 40

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:25:31.315646Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-15T20:25:31.100975Z digest=sha256:f6030c3e79dbb3535136efd452d9c8a37af47674b8f8d25db6efa930d9bc0597

Observation aef9d9d5-9aa1-4124-a0f2-5894db01ff40 · outbound

This paper cites The Llama 3 Herd of Models.

Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model The Llama 3 Herd of Models

Reference 41

Resolution
unresolved
no resolver link, observed 2026-08-15T20:25:31.105122Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:25:31.105122Z digest=sha256:1b31423d023f9cb0d9e58a2e85cdcc1abbc72030c608844e0ad3dd95cffed8ff

Pith citing papers

Observation 4ea2c479-b15d-413c-acd7-527324f5090a · inbound

Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model cites this paper.

Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model

Reference 1

Resolution
metadata mismatch
local_arxiv, observed 2026-08-15T20:25:31.304236Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-15T20:25:30.954743Z digest=sha256:d2da952939334c45df263d92419e76ad166d05e843fb064822ddac8b25704d87