{"as_of":"2026-08-20T16:56:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a3375ba949bbf7916cbc7358b59af4761a176aa33a1ab7d9eac44117384f5816","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T20:25:31.105122Z","state":"measured"},{"denominator":42,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":42,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T20:25:30.954743Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-15T20:25:31.298438Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.13062","last_updated":"2025-05-28T02:26:20Z","snapshot_observed_at":"2026-08-17T16:36:00.910239Z","submitted_at":"2025-05-19T12:52:51Z","title":"Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model","version":3},"cited_work":{"arxiv_id":"2505.13062","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.13062","snapshot_observed_at":"2026-08-15T20:25:31.298438Z","title":"Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model","venue":"cs.MM","work_id":"0c6c9e4f-259f-4ca2-8f6f-003ecb0b5240","year":2025},"citing_paper":{"arxiv_id":"2505.13062","last_updated":"2025-05-28T02:26:20Z","snapshot_observed_at":"2026-08-17T16:36:00.910239Z","submitted_at":"2025-05-19T12:52:51Z","title":"Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T20:25:30.954743Z"},"links":{"cited_paper":"/paper/2505.13062","citing_paper":"/paper/2505.13062"},"observation_digest":"sha256:d2da952939334c45df263d92419e76ad166d05e843fb064822ddac8b25704d87","observation_id":"4ea2c479-b15d-413c-acd7-527324f5090a","resolution":{"observed_at":"2026-08-15T20:25:31.304236Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.13062/citation-record","integrity":"/paper/2505.13062/integrity","json":"/paper/2505.13062/citation-record.json","paper":"/paper/2505.13062"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.13062","last_updated":"2025-05-28T02:26:20Z","snapshot_observed_at":"2026-08-17T16:36:00.910239Z","submitted_at":"2025-05-19T12:52:51Z","title":"Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model","version":3},"cited_work":{"arxiv_id":"2505.13062","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.13062","snapshot_observed_at":"2026-08-15T20:25:31.298438Z","title":"Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model","venue":"cs.MM","work_id":"0c6c9e4f-259f-4ca2-8f6f-003ecb0b5240","year":2025},"citing_paper":{"arxiv_id":"2505.13062","last_updated":"2025-05-28T02:26:20Z","snapshot_observed_at":"2026-08-17T16:36:00.910239Z","submitted_at":"2025-05-19T12:52:51Z","title":"Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T20:25:30.954743Z"},"links":{"cited_paper":"/paper/2505.13062","citing_paper":"/paper/2505.13062"},"observation_digest":"sha256:d2da952939334c45df263d92419e76ad166d05e843fb064822ddac8b25704d87","observation_id":"4ea2c479-b15d-413c-acd7-527324f5090a","resolution":{"observed_at":"2026-08-15T20:25:31.304236Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:25:31.517834Z","title":"SFT for SV AD Given a silent video V = I T t=1 withT frames, the SV AD task aims to generate a corresponding audio descriptionCaudio","venue":null,"work_id":"0babd06f-37d0-48d7-8871-0c04daaccc69","year":null},"citing_paper":{"arxiv_id":"2505.13062","last_updated":"2025-05-28T02:26:20Z","snapshot_observed_at":"2026-08-17T16:36:00.910239Z","submitted_at":"2025-05-19T12:52:51Z","title":"Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T20:25:30.963218Z"},"links":{"citing_paper":"/paper/2505.13062"},"observation_digest":"sha256:65cd9c22c06eb7cbe480d79e60dd3b3dd5f7b0a65c652fc88df69644ea04a206","observation_id":"f5731167-1c17-4eed-965a-c55997dc66e0","resolution":{"observed_at":"2026-08-15T20:25:31.521636Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:25:31.507194Z","title":null,"venue":null,"work_id":"c6f986e6-8168-47cc-9016-c17c1c259606","year":null},"citing_paper":{"arxiv_id":"2505.13062","last_updated":"2025-05-28T02:26:20Z","snapshot_observed_at":"2026-08-17T16:36:00.910239Z","submitted_at":"2025-05-19T12:52:51Z","title":"Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T20:25:30.967354Z"},"links":{"citing_paper":"/paper/2505.13062"},"observation_digest":"sha256:9d9d08adb7621f02890b932988fa52a0dceeb869939212cd4490adfd4bb95090","observation_id":"eaed0417-0dd9-4561-86bf-b27b85b69929","resolution":{"observed_at":"2026-08-15T20:25:31.510788Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:25:31.497044Z","title":null,"venue":null,"work_id":"830e61ff-ac27-40a3-9307-7a4e58d0b600","year":null},"citing_paper":{"arxiv_id":"2505.13062","last_updated":"2025-05-28T02:26:20Z","snapshot_observed_at":"2026-08-17T16:36:00.910239Z","submitted_at":"2025-05-19T12:52:51Z","title":"Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T20:25:30.971335Z"},"links":{"citing_paper":"/paper/2505.13062"},"observation_digest":"sha256:47503f98f87eed0be0c1f32f7382f0a5b6ca6772772269ec7523474319bba2f8","observation_id":"b1f99f45-1435-4309-ad95-58a9ab79dc68","resolution":{"observed_at":"2026-08-15T20:25:31.500577Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.03413","last_updated":"2024-04-04T12:46:01Z","snapshot_observed_at":"2026-08-16T14:03:39.369872Z","submitted_at":"2024-04-04T12:46:01Z","title":"MiniGPT4-Video: Advancing Multimodal LLMs for Video Understanding with Interleaved Visual-Textual Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.03413","snapshot_observed_at":"2026-08-15T20:25:30.990915Z","title":"Minigpt4-video: Advancing mul- timodal llms for video understanding with interleaved visual- textual tokens,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13062","last_updated":"2025-05-28T02:26:20Z","snapshot_observed_at":"2026-08-17T16:36:00.910239Z","submitted_at":"2025-05-19T12:52:51Z","title":"Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T20:25:30.990915Z"},"links":{"cited_paper":"/paper/2404.03413","citing_paper":"/paper/2505.13062"},"observation_digest":"sha256:c0582ee86caa3649c3173dd37146d7f272d36d6419f5e65588c76648e0ac8d0d","observation_id":"284182dc-e2cc-4900-a2d2-3ec29bfd01a3","resolution":{"observed_at":"2026-08-15T20:25:30.990915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:25:31.486279Z","title":"Multisensory- guided associative learning enhances multisensory representation in primary auditory cortex,","venue":null,"work_id":"39627957-4e6a-4f45-ba63-bc15bb069234","year":2022},"citing_paper":{"arxiv_id":"2505.13062","last_updated":"2025-05-28T02:26:20Z","snapshot_observed_at":"2026-08-17T16:36:00.910239Z","submitted_at":"2025-05-19T12:52:51Z","title":"Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T20:25:30.974975Z"},"links":{"citing_paper":"/paper/2505.13062"},"observation_digest":"sha256:b018576505d9522c9edfda438fa8e7e6b59fa61fe7f9e9b46f8f6d6cafb83c7b","observation_id":"1ce585bf-1cbd-46e4-8dea-10197763c2d2","resolution":{"observed_at":"2026-08-15T20:25:31.489915Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.13601","last_updated":"2024-05-28T05:36:23Z","snapshot_observed_at":"2026-08-16T14:24:48.404762Z","submitted_at":"2024-01-24T17:10:45Z","title":"MM-LLMs: Recent Advances in MultiModal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.13601","snapshot_observed_at":"2026-08-15T20:25:30.978656Z","title":"Mm-llms: Recent advances in multimodal large language mod- els,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13062","last_updated":"2025-05-28T02:26:20Z","snapshot_observed_at":"2026-08-17T16:36:00.910239Z","submitted_at":"2025-05-19T12:52:51Z","title":"Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T20:25:30.978656Z"},"links":{"cited_paper":"/paper/2401.13601","citing_paper":"/paper/2505.13062"},"observation_digest":"sha256:730c71c1ab786cf6b7fd0dceb014967fd4bf0dd64ce223cf9fcd5e9a0a727fea","observation_id":"77e07d20-e03f-49b3-88ca-f220eee99961","resolution":{"observed_at":"2026-08-15T20:25:30.978656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06355","last_updated":"2024-01-04T02:06:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-10T17:59:04Z","title":"VideoChat: Chat-Centric Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06355","snapshot_observed_at":"2026-08-15T20:25:30.982484Z","title":"Videochat: Chat-centric video under- standing,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.13062","last_updated":"2025-05-28T02:26:20Z","snapshot_observed_at":"2026-08-17T16:36:00.910239Z","submitted_at":"2025-05-19T12:52:51Z","title":"Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T20:25:30.982484Z"},"links":{"cited_paper":"/paper/2305.06355","citing_paper":"/paper/2505.13062"},"observation_digest":"sha256:2d9276f4ff5966cd980a11f2930ed77a67da2b2d82af2a3b20b2477eed8844b0","observation_id":"362b949f-dad6-4244-a3b8-c006b8b180b2","resolution":{"observed_at":"2026-08-15T20:25:30.982484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10122","snapshot_observed_at":"2026-08-15T20:25:30.986800Z","title":"Video- llava: Learning united visual representation by alignment before projection,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.13062","last_updated":"2025-05-28T02:26:20Z","snapshot_observed_at":"2026-08-17T16:36:00.910239Z","submitted_at":"2025-05-19T12:52:51Z","title":"Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T20:25:30.986800Z"},"links":{"cited_paper":"/paper/2311.10122","citing_paper":"/paper/2505.13062"},"observation_digest":"sha256:8ed46965fd95e83af8a7ba8fa9c990a6d098c0a1b22aea859cd6799908cef3fc","observation_id":"2196f4a7-e8cf-44d3-8da0-5a3c6c9a569c","resolution":{"observed_at":"2026-08-15T20:25:30.986800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.08601","last_updated":"2025-03-24T04:00:01Z","snapshot_observed_at":"2026-08-16T13:18:54.200196Z","submitted_at":"2024-09-13T07:31:44Z","title":"STA-V2A: Video-to-Audio Generation with Semantic and Temporal Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.08601","snapshot_observed_at":"2026-08-15T20:25:31.011778Z","title":"Sta-v2a: Video-to-audio generation with semantic and temporal alignment,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13062","last_updated":"2025-05-28T02:26:20Z","snapshot_observed_at":"2026-08-17T16:36:00.910239Z","submitted_at":"2025-05-19T12:52:51Z","title":"Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T20:25:31.011778Z"},"links":{"cited_paper":"/paper/2409.08601","citing_paper":"/paper/2505.13062"},"observation_digest":"sha256:3cd21d99f490385ac2bcbe60ab2f95db73c675ae05242d8d3da5a13fba2c8f12","observation_id":"4c19d327-59f8-4445-8d81-db6b18681e49","resolution":{"observed_at":"2026-08-15T20:25:31.011778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07464","last_updated":"2025-03-11T15:57:51Z","snapshot_observed_at":"2026-08-16T13:35:31.640872Z","submitted_at":"2024-07-10T08:40:39Z","title":"Video-to-Audio Generation with Hidden Alignment","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07464","snapshot_observed_at":"2026-08-15T20:25:30.995667Z","title":"Video-to-audio generation with hidden alignment,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13062","last_updated":"2025-05-28T02:26:20Z","snapshot_observed_at":"2026-08-17T16:36:00.910239Z","submitted_at":"2025-05-19T12:52:51Z","title":"Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T20:25:30.995667Z"},"links":{"cited_paper":"/paper/2407.07464","citing_paper":"/paper/2505.13062"},"observation_digest":"sha256:a396ecffb9ddd6f2d75aa1804607475539443943537519e82f0b76ee313fea96","observation_id":"9ae3ddbc-b652-4a76-839e-9901d10ec1b6","resolution":{"observed_at":"2026-08-15T20:25:30.995667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.00320","last_updated":"2025-01-04T18:12:07Z","snapshot_observed_at":"2026-08-19T20:13:28.395800Z","submitted_at":"2024-06-01T06:40:22Z","title":"Frieren: Efficient Video-to-Audio Generation Network with Rectified Flow Matching","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.00320","snapshot_observed_at":"2026-08-15T20:25:30.999910Z","title":"Frieren: Efficient video-to-audio generation with rectified flow matching,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13062","last_updated":"2025-05-28T02:26:20Z","snapshot_observed_at":"2026-08-17T16:36:00.910239Z","submitted_at":"2025-05-19T12:52:51Z","title":"Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T20:25:30.999910Z"},"links":{"cited_paper":"/paper/2406.00320","citing_paper":"/paper/2505.13062"},"observation_digest":"sha256:54137301a2166cc5a230395f82f2f025ec9f3e8f3445325a6c6d49b4cacca81c","observation_id":"f15cd0ab-403f-4041-baad-11197ebdf900","resolution":{"observed_at":"2026-08-15T20:25:30.999910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:25:31.475236Z","title":"V2a- mapper: A lightweight solution for vision-to-audio generation by connecting foundation models,","venue":null,"work_id":"3b502579-9269-44b6-b75e-7c65114ed0f7","year":2024},"citing_paper":{"arxiv_id":"2505.13062","last_updated":"2025-05-28T02:26:20Z","snapshot_observed_at":"2026-08-17T16:36:00.910239Z","submitted_at":"2025-05-19T12:52:51Z","title":"Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T20:25:31.004061Z"},"links":{"citing_paper":"/paper/2505.13062"},"observation_digest":"sha256:6e538c4bcd2ae9bcb61e45e780b19f2eb48d8a6d9e015bfefc1b61a8b7d27515","observation_id":"44878e4b-545a-41f0-a16e-fceac3f57f41","resolution":{"observed_at":"2026-08-15T20:25:31.478939Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:25:31.464588Z","title":"Foleygen: Visually-guided audio generation,","venue":null,"work_id":"d3095917-e600-4879-9472-beabf04368df","year":2024},"citing_paper":{"arxiv_id":"2505.13062","last_updated":"2025-05-28T02:26:20Z","snapshot_observed_at":"2026-08-17T16:36:00.910239Z","submitted_at":"2025-05-19T12:52:51Z","title":"Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T20:25:31.007650Z"},"links":{"citing_paper":"/paper/2505.13062"},"observation_digest":"sha256:59b11737f8613815ba1c786d33fbfc745534739e945d0f8385d22df44ab5f232","observation_id":"feace7b4-450d-4946-b42d-21e6045664e0","resolution":{"observed_at":"2026-08-15T20:25:31.468363Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:25:31.030495Z","title":"Wavcaps: A chatgpt-assisted weakly- labelled audio captioning dataset for audio-language multimodal research,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13062","last_updated":"2025-05-28T02:26:20Z","snapshot_observed_at":"2026-08-17T16:36:00.910239Z","submitted_at":"2025-05-19T12:52:51Z","title":"Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T20:25:31.030495Z"},"links":{"citing_paper":"/paper/2505.13062"},"observation_digest":"sha256:9e7a7d219b1954e69f61d4f51565ff3f465fc82ad3dea3c014def7b4e4c1e1af","observation_id":"18472efb-57f1-4f3f-b574-bca98d354bf9","resolution":{"observed_at":"2026-08-15T20:25:31.030495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07938","last_updated":"2024-03-08T22:27:38Z","snapshot_observed_at":"2026-08-16T14:11:28.782356Z","submitted_at":"2024-03-08T22:27:38Z","title":"Text-to-Audio Generation Synchronized with Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.07938","snapshot_observed_at":"2026-08-15T20:25:31.015693Z","title":"Text-to-audio generation synchronized with videos,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13062","last_updated":"2025-05-28T02:26:20Z","snapshot_observed_at":"2026-08-17T16:36:00.910239Z","submitted_at":"2025-05-19T12:52:51Z","title":"Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T20:25:31.015693Z"},"links":{"cited_paper":"/paper/2403.07938","citing_paper":"/paper/2505.13062"},"observation_digest":"sha256:7f7a17b8185eb718b37ebeda5d022e5d7a81683262c724509cda6b0e3832b9e6","observation_id":"25a35509-3055-4ad8-a498-f9160489027d","resolution":{"observed_at":"2026-08-15T20:25:31.015693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01494","last_updated":"2024-07-01T17:35:56Z","snapshot_observed_at":"2026-08-19T13:11:56.801120Z","submitted_at":"2024-07-01T17:35:56Z","title":"FoleyCrafter: Bring Silent Videos to Life with Lifelike and Synchronized Sounds","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01494","snapshot_observed_at":"2026-08-15T20:25:31.019247Z","title":"Foleycrafter: Bring silent videos to life with lifelike and synchro- nized sounds,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13062","last_updated":"2025-05-28T02:26:20Z","snapshot_observed_at":"2026-08-17T16:36:00.910239Z","submitted_at":"2025-05-19T12:52:51Z","title":"Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T20:25:31.019247Z"},"links":{"cited_paper":"/paper/2407.01494","citing_paper":"/paper/2505.13062"},"observation_digest":"sha256:ccaf615841917dd60737974e263229d0cceba4d9059dd64274e8cd5c9198cf2f","observation_id":"8fb3c112-9498-4a3f-b0fe-a785e763ebd2","resolution":{"observed_at":"2026-08-15T20:25:31.019247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05551","last_updated":"2024-12-26T15:23:36Z","snapshot_observed_at":"2026-08-19T12:24:58.835427Z","submitted_at":"2024-07-08T01:59:17Z","title":"Read, Watch and Scream! Sound Generation from Text and Video","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05551","snapshot_observed_at":"2026-08-15T20:25:31.022815Z","title":"Read, watch and scream! sound generation from text and video,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13062","last_updated":"2025-05-28T02:26:20Z","snapshot_observed_at":"2026-08-17T16:36:00.910239Z","submitted_at":"2025-05-19T12:52:51Z","title":"Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T20:25:31.022815Z"},"links":{"cited_paper":"/paper/2407.05551","citing_paper":"/paper/2505.13062"},"observation_digest":"sha256:94dadc3b699e9cdd08fa70f393c073e59b831a12ef4020630cb5076b7558434c","observation_id":"a03c0787-f0c9-4648-ac43-3779aea4f037","resolution":{"observed_at":"2026-08-15T20:25:31.022815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15023","last_updated":"2025-05-05T16:55:53Z","snapshot_observed_at":"2026-08-17T16:57:32.768924Z","submitted_at":"2024-12-19T16:37:19Z","title":"FolAI: Synchronized Foley Sound Generation with Semantic and Temporal Alignment","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15023","snapshot_observed_at":"2026-08-15T20:25:31.026317Z","title":"Stable-v2a: Syn- thesis of synchronized sound effects with temporal and semantic controls,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13062","last_updated":"2025-05-28T02:26:20Z","snapshot_observed_at":"2026-08-17T16:36:00.910239Z","submitted_at":"2025-05-19T12:52:51Z","title":"Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T20:25:31.026317Z"},"links":{"cited_paper":"/paper/2412.15023","citing_paper":"/paper/2505.13062"},"observation_digest":"sha256:c145d65842a4311f156becc79b213ecbc39f8b1be590474c5ea839c59ae6057b","observation_id":"f584c6a1-2a11-49c5-8f75-1f9adfd55165","resolution":{"observed_at":"2026-08-15T20:25:31.026317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09291","last_updated":"2025-03-15T12:38:50Z","snapshot_observed_at":"2026-08-16T11:13:43.640159Z","submitted_at":"2025-01-16T04:53:29Z","title":"LAVCap: LLM-based Audio-Visual Captioning using Optimal Transport","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09291","snapshot_observed_at":"2026-08-15T20:25:31.048189Z","title":"Lavcap: Llm-based audio-visual captioning using optimal transport,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.13062","last_updated":"2025-05-28T02:26:20Z","snapshot_observed_at":"2026-08-17T16:36:00.910239Z","submitted_at":"2025-05-19T12:52:51Z","title":"Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T20:25:31.048189Z"},"links":{"cited_paper":"/paper/2501.09291","citing_paper":"/paper/2505.13062"},"observation_digest":"sha256:d08901f10500ca6fb65a102b0e21014cc8a821eb614d0d20ea58f224c73a151f","observation_id":"92e1dd92-2121-47ad-9bc6-fa069eb0e06c","resolution":{"observed_at":"2026-08-15T20:25:31.048189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:25:31.033984Z","title":"Conette: An efficient au- dio captioning system leveraging multiple datasets with task em- bedding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13062","last_updated":"2025-05-28T02:26:20Z","snapshot_observed_at":"2026-08-17T16:36:00.910239Z","submitted_at":"2025-05-19T12:52:51Z","title":"Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T20:25:31.033984Z"},"links":{"citing_paper":"/paper/2505.13062"},"observation_digest":"sha256:26422edc7fc8dcda8b7e960ffa956edbd3cf17c5b6e4ea67b24c0b72b0ea87c9","observation_id":"7707387e-fe86-4ddf-82f1-7b08dc136b3c","resolution":{"observed_at":"2026-08-15T20:25:31.033984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:25:31.441513Z","title":"Automatic video captioning using tree hierarchical deep convolutional neu- ral network and asrnn-bi-directional lstm,","venue":null,"work_id":"6098508e-8541-4fa6-aeaf-5ce919def1e7","year":2024},"citing_paper":{"arxiv_id":"2505.13062","last_updated":"2025-05-28T02:26:20Z","snapshot_observed_at":"2026-08-17T16:36:00.910239Z","submitted_at":"2025-05-19T12:52:51Z","title":"Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T20:25:31.037314Z"},"links":{"citing_paper":"/paper/2505.13062"},"observation_digest":"sha256:3c4b04696fe8568ba1750a10b36ebcad98f34b229331dcbff499483eb53718e2","observation_id":"678a54ef-0ac2-4661-a5e2-11c78754244a","resolution":{"observed_at":"2026-08-15T20:25:31.445167Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:25:31.430656Z","title":"Streaming dense video captioning,","venue":null,"work_id":"cd437627-c595-454e-ad46-60169634d4d1","year":2024},"citing_paper":{"arxiv_id":"2505.13062","last_updated":"2025-05-28T02:26:20Z","snapshot_observed_at":"2026-08-17T16:36:00.910239Z","submitted_at":"2025-05-19T12:52:51Z","title":"Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T20:25:31.040976Z"},"links":{"citing_paper":"/paper/2505.13062"},"observation_digest":"sha256:8f1da6ec6e9371450ad741b6c269be2d2231a93b6f7ec8b05068a18af0c90f3d","observation_id":"dbbae53a-3ae4-421f-9fee-05f82fe597b7","resolution":{"observed_at":"2026-08-15T20:25:31.434478Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07801","last_updated":"2024-07-11T02:38:14Z","snapshot_observed_at":"2026-08-19T17:34:28.490385Z","submitted_at":"2024-07-10T16:17:49Z","title":"AVCap: Leveraging Audio-Visual Features as Text Tokens for Captioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07801","snapshot_observed_at":"2026-08-15T20:25:31.044527Z","title":"Avcap: Leveraging audio- visual features as text tokens for captioning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13062","last_updated":"2025-05-28T02:26:20Z","snapshot_observed_at":"2026-08-17T16:36:00.910239Z","submitted_at":"2025-05-19T12:52:51Z","title":"Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T20:25:31.044527Z"},"links":{"cited_paper":"/paper/2407.07801","citing_paper":"/paper/2505.13062"},"observation_digest":"sha256:072723c144c0b7fd1b6659779ec9f150b92faf0f9d2ba2359653bc6418e76374","observation_id":"d77a8053-30e2-4f0f-a42a-4f421eb3052c","resolution":{"observed_at":"2026-08-15T20:25:31.044527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:25:31.399601Z","title":"LoRA: Low-Rank Adaptation of Large Language Models,","venue":null,"work_id":"a75637ff-309a-4d53-bc67-ee3da8654622","year":2022},"citing_paper":{"arxiv_id":"2505.13062","last_updated":"2025-05-28T02:26:20Z","snapshot_observed_at":"2026-08-17T16:36:00.910239Z","submitted_at":"2025-05-19T12:52:51Z","title":"Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T20:25:31.066625Z"},"links":{"citing_paper":"/paper/2505.13062"},"observation_digest":"sha256:8fca16e163a642fb5f2777c97b8113a0465c9e69bd10d6ff95f8356de35ec379","observation_id":"82eef265-2b49-4bf9-bda8-ddcdf46e4150","resolution":{"observed_at":"2026-08-15T20:25:31.403181Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:25:31.528403Z","title":null,"venue":null,"work_id":"764819f5-795c-4fdb-a362-db428d498b57","year":null},"citing_paper":{"arxiv_id":"2505.13062","last_updated":"2025-05-28T02:26:20Z","snapshot_observed_at":"2026-08-17T16:36:00.910239Z","submitted_at":"2025-05-19T12:52:51Z","title":"Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T20:25:30.959376Z"},"links":{"citing_paper":"/paper/2505.13062"},"observation_digest":"sha256:97d9ba890d5569dc43c3bb4f02327307bde85b82244f0a0f5c6c5ec63e0221db","observation_id":"dd4e23ca-97e8-42fd-9630-4ff4ae785269","resolution":{"observed_at":"2026-08-15T20:25:31.531676Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:25:31.420443Z","title":"An eye for an ear: zero-shot audio description leveraging an image captioner with audio-visual token distribution matching,","venue":null,"work_id":"b263c885-8609-492e-9298-cd5bda07f442","year":2025},"citing_paper":{"arxiv_id":"2505.13062","last_updated":"2025-05-28T02:26:20Z","snapshot_observed_at":"2026-08-17T16:36:00.910239Z","submitted_at":"2025-05-19T12:52:51Z","title":"Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T20:25:31.051720Z"},"links":{"citing_paper":"/paper/2505.13062"},"observation_digest":"sha256:349eac86f55b7f4ad6476adce530438b54e1e4bf4f1381be5a9609da405dc9cb","observation_id":"74fa0396-0ea8-4937-835c-55415ff7c5d2","resolution":{"observed_at":"2026-08-15T20:25:31.424081Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-08-14T16:25:22.654846Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07476","snapshot_observed_at":"2026-08-15T20:25:31.055296Z","title":"Videollama 2: Advanc- ing spatial-temporal modeling and audio understanding in video- llms,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13062","last_updated":"2025-05-28T02:26:20Z","snapshot_observed_at":"2026-08-17T16:36:00.910239Z","submitted_at":"2025-05-19T12:52:51Z","title":"Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T20:25:31.055296Z"},"links":{"cited_paper":"/paper/2406.07476","citing_paper":"/paper/2505.13062"},"observation_digest":"sha256:594d846524437d1aaf02d0c637fc699dd3d24aed8a2abf23f1bbc1595b19c1de","observation_id":"9b4b0f06-7b50-45f8-89ba-2a35155a16aa","resolution":{"observed_at":"2026-08-15T20:25:31.055296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12961","last_updated":"2025-02-27T06:09:46Z","snapshot_observed_at":"2026-08-16T13:17:05.325564Z","submitted_at":"2024-09-19T17:59:51Z","title":"Oryx MLLM: On-Demand Spatial-Temporal Understanding at Arbitrary Resolution","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12961","snapshot_observed_at":"2026-08-15T20:25:31.059117Z","title":"Oryx mllm: On-demand spatial-temporal understanding at arbitrary resolu- tion,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13062","last_updated":"2025-05-28T02:26:20Z","snapshot_observed_at":"2026-08-17T16:36:00.910239Z","submitted_at":"2025-05-19T12:52:51Z","title":"Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T20:25:31.059117Z"},"links":{"cited_paper":"/paper/2409.12961","citing_paper":"/paper/2505.13062"},"observation_digest":"sha256:f19ff4523d5ee5ed145bee2dce844ab31a0063de68aa46aaca9592939dff1457","observation_id":"85d49c75-0db9-4a8b-a2c5-6836a03b46f8","resolution":{"observed_at":"2026-08-15T20:25:31.059117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:25:31.410088Z","title":"Internvl: Scaling up vision foun- dation models and aligning for generic visual-linguistic tasks,","venue":null,"work_id":"7d75f381-9774-4518-942a-61c08c5eb590","year":2024},"citing_paper":{"arxiv_id":"2505.13062","last_updated":"2025-05-28T02:26:20Z","snapshot_observed_at":"2026-08-17T16:36:00.910239Z","submitted_at":"2025-05-19T12:52:51Z","title":"Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T20:25:31.063165Z"},"links":{"citing_paper":"/paper/2505.13062"},"observation_digest":"sha256:ca46c677f0b1fda3516f4960b1f0e0e5feeb5177a5b759777443198285976973","observation_id":"243a8b76-21f5-40d4-8d5f-b7a273d96fda","resolution":{"observed_at":"2026-08-15T20:25:31.413892Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:25:31.070010Z","title":"Chain-of-thought prompting elicits reasoning in large language models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.13062","last_updated":"2025-05-28T02:26:20Z","snapshot_observed_at":"2026-08-17T16:36:00.910239Z","submitted_at":"2025-05-19T12:52:51Z","title":"Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T20:25:31.070010Z"},"links":{"citing_paper":"/paper/2505.13062"},"observation_digest":"sha256:17a8cca76aa3b2106c8d7cdb7f249722c3a7f472434c2a94e8f29741c6bbc871","observation_id":"37f408ac-3dd9-45af-b12c-26f66d1d4934","resolution":{"observed_at":"2026-08-15T20:25:31.070010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:25:31.073254Z","title":"Audiocaps: Generat- ing captions for audios in the wild,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.13062","last_updated":"2025-05-28T02:26:20Z","snapshot_observed_at":"2026-08-17T16:36:00.910239Z","submitted_at":"2025-05-19T12:52:51Z","title":"Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T20:25:31.073254Z"},"links":{"citing_paper":"/paper/2505.13062"},"observation_digest":"sha256:5706c8abf96ae774d09cbd7461e514e7beacc168db7e1061b78fadcf7d9cd967","observation_id":"bd2efa4d-726f-4c0b-8bd7-2e9e2e40e59f","resolution":{"observed_at":"2026-08-15T20:25:31.073254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-08-15T14:02:47.366139Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-15T20:25:31.076500Z","title":"Gpt-4o system card,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13062","last_updated":"2025-05-28T02:26:20Z","snapshot_observed_at":"2026-08-17T16:36:00.910239Z","submitted_at":"2025-05-19T12:52:51Z","title":"Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T20:25:31.076500Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2505.13062"},"observation_digest":"sha256:7982b1b96549bbe937f9ec0a59ea107bc8be8b9ca60c264555c69c57863b5fe0","observation_id":"a8375c5c-9baf-456c-9441-576008fcf55d","resolution":{"observed_at":"2026-08-15T20:25:31.076500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:25:31.376648Z","title":"Large-scale contrastive language-audio pretraining with feature fusion and keyword-to-caption augmentation,","venue":null,"work_id":"c84e39dc-8d7d-4971-a295-70242f83577c","year":2023},"citing_paper":{"arxiv_id":"2505.13062","last_updated":"2025-05-28T02:26:20Z","snapshot_observed_at":"2026-08-17T16:36:00.910239Z","submitted_at":"2025-05-19T12:52:51Z","title":"Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T20:25:31.079772Z"},"links":{"citing_paper":"/paper/2505.13062"},"observation_digest":"sha256:dbe7dca45251cf01db4dafc625340b252f775219263f0433c9a884a42c135add","observation_id":"98e3f8bc-e07e-4d65-96e2-5a71e5504bab","resolution":{"observed_at":"2026-08-15T20:25:31.380074Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:25:31.365320Z","title":"Bleu: a method for automatic evaluation of machine translation,","venue":null,"work_id":"adb091c7-0f71-45fd-91ce-3ed270552fce","year":2002},"citing_paper":{"arxiv_id":"2505.13062","last_updated":"2025-05-28T02:26:20Z","snapshot_observed_at":"2026-08-17T16:36:00.910239Z","submitted_at":"2025-05-19T12:52:51Z","title":"Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T20:25:31.083009Z"},"links":{"citing_paper":"/paper/2505.13062"},"observation_digest":"sha256:e2720068a0c7a662c08b5d8fa57b61a7839456c14feb2305034999c62c06cb43","observation_id":"e4209607-048a-4018-8810-7e9937d9f066","resolution":{"observed_at":"2026-08-15T20:25:31.369004Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:25:31.353600Z","title":"Meteor: An automatic metric for mt evaluation with improved correlation with human judgments,","venue":null,"work_id":"ebd14b16-3903-4c5a-9716-a046fee8ec87","year":2005},"citing_paper":{"arxiv_id":"2505.13062","last_updated":"2025-05-28T02:26:20Z","snapshot_observed_at":"2026-08-17T16:36:00.910239Z","submitted_at":"2025-05-19T12:52:51Z","title":"Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T20:25:31.086629Z"},"links":{"citing_paper":"/paper/2505.13062"},"observation_digest":"sha256:e4db7d7d3fc633c0fdc0af930c80a061f288f042d595d98f3b9f42ed7dcfa523","observation_id":"ca474cb5-5e15-4d39-8400-74b900f0eab9","resolution":{"observed_at":"2026-08-15T20:25:31.357837Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:25:31.343368Z","title":"Rouge: A package for automatic evaluation of sum- maries,","venue":null,"work_id":"365a2c82-2660-478a-aa75-95a39891c827","year":2004},"citing_paper":{"arxiv_id":"2505.13062","last_updated":"2025-05-28T02:26:20Z","snapshot_observed_at":"2026-08-17T16:36:00.910239Z","submitted_at":"2025-05-19T12:52:51Z","title":"Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T20:25:31.089834Z"},"links":{"citing_paper":"/paper/2505.13062"},"observation_digest":"sha256:3cc0276f4491e9f3b58fdb97be4466f29c58187f6d7fcbc0e601160a5045f2bd","observation_id":"c7563e6a-e57e-4d09-988a-1600ab5f93cf","resolution":{"observed_at":"2026-08-15T20:25:31.346844Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:25:31.333409Z","title":"Cider: Consensus-based image description evaluation,","venue":null,"work_id":"157d85a4-3867-4cfb-a7f9-7ce416e82211","year":2015},"citing_paper":{"arxiv_id":"2505.13062","last_updated":"2025-05-28T02:26:20Z","snapshot_observed_at":"2026-08-17T16:36:00.910239Z","submitted_at":"2025-05-19T12:52:51Z","title":"Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T20:25:31.093343Z"},"links":{"citing_paper":"/paper/2505.13062"},"observation_digest":"sha256:7a24946ae7d8934a258be06b354b6fcecafd78db35be6d426275e51828563aea","observation_id":"c4be74c4-4337-4175-8cf9-e9c46ee7b2af","resolution":{"observed_at":"2026-08-15T20:25:31.336845Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:25:31.322767Z","title":"Spice: Se- mantic propositional image caption evaluation,","venue":null,"work_id":"0287c932-bb38-444d-86aa-9d487f59bcd1","year":2016},"citing_paper":{"arxiv_id":"2505.13062","last_updated":"2025-05-28T02:26:20Z","snapshot_observed_at":"2026-08-17T16:36:00.910239Z","submitted_at":"2025-05-19T12:52:51Z","title":"Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T20:25:31.097455Z"},"links":{"citing_paper":"/paper/2505.13062"},"observation_digest":"sha256:8779a01bb5cfe9b627f51abee42131f0f856f61edbaa88994c7512a971a17b87","observation_id":"0a9bf1a8-5169-4aa7-8c10-824cf5de2467","resolution":{"observed_at":"2026-08-15T20:25:31.326264Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:25:31.311737Z","title":"Diverse and aligned audio-to-video generation via text-to-video model adaptation,","venue":null,"work_id":"e20c8836-cc22-4ce2-817d-7fc829441559","year":2024},"citing_paper":{"arxiv_id":"2505.13062","last_updated":"2025-05-28T02:26:20Z","snapshot_observed_at":"2026-08-17T16:36:00.910239Z","submitted_at":"2025-05-19T12:52:51Z","title":"Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T20:25:31.100975Z"},"links":{"citing_paper":"/paper/2505.13062"},"observation_digest":"sha256:f6030c3e79dbb3535136efd452d9c8a37af47674b8f8d25db6efa930d9bc0597","observation_id":"b3fb4b55-5c87-4e36-b638-651ffbeb94f6","resolution":{"observed_at":"2026-08-15T20:25:31.315646Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-15T20:25:31.105122Z","title":"The llama 3 herd of models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13062","last_updated":"2025-05-28T02:26:20Z","snapshot_observed_at":"2026-08-17T16:36:00.910239Z","submitted_at":"2025-05-19T12:52:51Z","title":"Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T20:25:31.105122Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2505.13062"},"observation_digest":"sha256:1b31423d023f9cb0d9e58a2e85cdcc1abbc72030c608844e0ad3dd95cffed8ff","observation_id":"aef9d9d5-9aa1-4124-a0f2-5894db01ff40","resolution":{"observed_at":"2026-08-15T20:25:31.105122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.13062","last_updated":"2025-05-28T02:26:20Z","latest_version":3,"primary_category":"cs.MM","snapshot_observed_at":"2026-08-17T16:36:00.910239Z","submitted_at":"2025-05-19T12:52:51Z","title":"Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":1,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":23,"verified_exact":0,"verified_fuzzy":16},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 1 inbound Pith citation observation for arXiv:2505.13062."}