{"as_of":"2026-08-20T09:31:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2154b2fc69218539e4dba31aa6fc811a4bd7764db43bd3b06c703d44aba4e6b5","coverage":[{"denominator":29,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":29,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T20:14:24.131196Z","state":"measured"},{"denominator":33,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":33,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T20:25:31.048189Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T10:16:56.891207Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.09291","last_updated":"2025-03-15T12:38:50Z","snapshot_observed_at":"2026-08-16T11:13:43.640159Z","submitted_at":"2025-01-16T04:53:29Z","title":"LAVCap: LLM-based Audio-Visual Captioning using Optimal Transport","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09291","snapshot_observed_at":"2026-08-15T20:25:31.048189Z","title":"Lavcap: Llm-based audio-visual captioning using optimal transport,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.13062","last_updated":"2025-05-28T02:26:20Z","snapshot_observed_at":"2026-08-17T16:36:00.910239Z","submitted_at":"2025-05-19T12:52:51Z","title":"Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T20:25:31.048189Z"},"links":{"cited_paper":"/paper/2501.09291","citing_paper":"/paper/2505.13062"},"observation_digest":"sha256:d08901f10500ca6fb65a102b0e21014cc8a821eb614d0d20ea58f224c73a151f","observation_id":"92e1dd92-2121-47ad-9bc6-fa069eb0e06c","resolution":{"observed_at":"2026-08-15T20:25:31.048189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09291","last_updated":"2025-03-15T12:38:50Z","snapshot_observed_at":"2026-08-16T11:13:43.640159Z","submitted_at":"2025-01-16T04:53:29Z","title":"LAVCap: LLM-based Audio-Visual Captioning using Optimal Transport","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09291","snapshot_observed_at":"2026-08-07T13:20:16.225698Z","title":"Lavcap: Llm-based audio-visual captioning using optimal transport,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22045","last_updated":"2025-05-28T07:08:17Z","snapshot_observed_at":"2026-08-19T10:12:59.859968Z","submitted_at":"2025-05-28T07:08:17Z","title":"Mitigating Audiovisual Mismatch in Visual-Guide Audio Captioning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:16.225698Z"},"links":{"cited_paper":"/paper/2501.09291","citing_paper":"/paper/2505.22045"},"observation_digest":"sha256:96463334372fd027128693fbd242ebe9ad9c057ad5c76248b5c83ff327669f78","observation_id":"21c84687-edff-4251-a172-5b1d6519ca57","resolution":{"observed_at":"2026-08-07T13:20:16.225698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09291","last_updated":"2025-03-15T12:38:50Z","snapshot_observed_at":"2026-08-16T11:13:43.640159Z","submitted_at":"2025-01-16T04:53:29Z","title":"LAVCap: LLM-based Audio-Visual Captioning using Optimal Transport","version":2},"cited_work":{"arxiv_id":"2501.09291","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.09291","snapshot_observed_at":"2026-08-07T10:16:56.891207Z","title":"LAVCap: LLM-based Audio-Visual Captioning using Optimal Transport","venue":"cs.MM","work_id":"08482a98-9bb9-4481-b462-647de195b437","year":2025},"citing_paper":{"arxiv_id":"2506.05899","last_updated":"2025-06-06T09:12:51Z","snapshot_observed_at":"2026-08-19T03:09:43.469171Z","submitted_at":"2025-06-06T09:12:51Z","title":"WhisQ: Cross-Modal Representation Learning for Text-to-Music MOS Prediction","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T10:16:56.175634Z"},"links":{"cited_paper":"/paper/2501.09291","citing_paper":"/paper/2506.05899"},"observation_digest":"sha256:a9465f89ba032df3a3c21a779e09a396c277997a33f74caf80d533e0db64010d","observation_id":"0e99131c-60e1-43be-b897-8b27fd569fc6","resolution":{"observed_at":"2026-08-07T10:16:57.039584Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09291","last_updated":"2025-03-15T12:38:50Z","snapshot_observed_at":"2026-08-16T11:13:43.640159Z","submitted_at":"2025-01-16T04:53:29Z","title":"LAVCap: LLM-based Audio-Visual Captioning using Optimal Transport","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09291","snapshot_observed_at":"2026-07-13T01:06:45.040464Z","title":"LA VCap: LLM-based Audio-Visual Captioning using Optimal Transport,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09001","last_updated":"2026-08-13T08:46:40Z","snapshot_observed_at":"2026-08-17T18:21:32.409856Z","submitted_at":"2026-07-10T00:07:25Z","title":"Optimal Transport-based Semantic Alignment for LLM-based Audio-Visual Speech Recognition","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-13T01:06:45.040464Z"},"links":{"cited_paper":"/paper/2501.09291","citing_paper":"/paper/2607.09001"},"observation_digest":"sha256:71206136b22d8130840d896b785488729b0dda184f726a0fc2ee4994314720c5","observation_id":"840821bc-8bd9-41ef-9568-2393b100d7b9","resolution":{"observed_at":"2026-07-13T01:06:45.040464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2501.09291/citation-record","integrity":"/paper/2501.09291/integrity","json":"/paper/2501.09291/citation-record.json","paper":"/paper/2501.09291"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:24.514158Z","title":"Per- sonalized dialogue generation with persona-adaptive attention,","venue":null,"work_id":"2059c7d3-a296-4e1d-9622-9d93a2896ec9","year":2023},"citing_paper":{"arxiv_id":"2501.09291","last_updated":"2025-03-15T12:38:50Z","snapshot_observed_at":"2026-08-16T11:13:43.640159Z","submitted_at":"2025-01-16T04:53:29Z","title":"LAVCap: LLM-based Audio-Visual Captioning using Optimal Transport","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:24.014439Z"},"links":{"citing_paper":"/paper/2501.09291"},"observation_digest":"sha256:712a4940731d0c31057d2544078f49b4a453c751e525aef982a1c3ef01f2f45e","observation_id":"974f417b-d9b5-4d9d-917e-128056c9b1a1","resolution":{"observed_at":"2026-08-10T20:14:24.518296Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:24.502115Z","title":"Audio captioning transformer,","venue":null,"work_id":"5f8e5f63-c58d-4d27-bec6-3c13d24d48fc","year":2021},"citing_paper":{"arxiv_id":"2501.09291","last_updated":"2025-03-15T12:38:50Z","snapshot_observed_at":"2026-08-16T11:13:43.640159Z","submitted_at":"2025-01-16T04:53:29Z","title":"LAVCap: LLM-based Audio-Visual Captioning using Optimal Transport","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:24.019499Z"},"links":{"citing_paper":"/paper/2501.09291"},"observation_digest":"sha256:4dc45dbb4d18322d5ae745ca9fe019dc1926a2e3b99dc65fa643a36077411f96","observation_id":"2ff738c1-256a-4033-ac6d-f057331c2e68","resolution":{"observed_at":"2026-08-10T20:14:24.506292Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:24.488599Z","title":"Automated audio captioning by fine-tuning bart with audioset tags,","venue":null,"work_id":"96613bdd-f318-460b-928c-b4091b039ec1","year":2021},"citing_paper":{"arxiv_id":"2501.09291","last_updated":"2025-03-15T12:38:50Z","snapshot_observed_at":"2026-08-16T11:13:43.640159Z","submitted_at":"2025-01-16T04:53:29Z","title":"LAVCap: LLM-based Audio-Visual Captioning using Optimal Transport","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:24.023616Z"},"links":{"citing_paper":"/paper/2501.09291"},"observation_digest":"sha256:e881408be9b89c770a8d36d1593bbd91b21dbc7769af1fb26c8dd0cf096e25e3","observation_id":"da985451-d8cc-4ba1-be86-2aa26fec6383","resolution":{"observed_at":"2026-08-10T20:14:24.493629Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:24.476039Z","title":"Prefix tuning for automated audio captioning,","venue":null,"work_id":"ecd95e49-3dc1-4a73-a85c-891248e66861","year":2023},"citing_paper":{"arxiv_id":"2501.09291","last_updated":"2025-03-15T12:38:50Z","snapshot_observed_at":"2026-08-16T11:13:43.640159Z","submitted_at":"2025-01-16T04:53:29Z","title":"LAVCap: LLM-based Audio-Visual Captioning using Optimal Transport","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:24.027723Z"},"links":{"citing_paper":"/paper/2501.09291"},"observation_digest":"sha256:e9b82e8a9c267be5e264a467283756257ddbadb95c33686451ef6b4272dc1719","observation_id":"52b502a1-bc15-415e-b84a-91db1ab7bc0e","resolution":{"observed_at":"2026-08-10T20:14:24.480282Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:24.463626Z","title":"EnCLAP: Combining neural audio codec and audio-text joint embedding for automated audio cap- tioning,","venue":null,"work_id":"671b4d70-c14c-476c-9f7e-338142dbbafc","year":2024},"citing_paper":{"arxiv_id":"2501.09291","last_updated":"2025-03-15T12:38:50Z","snapshot_observed_at":"2026-08-16T11:13:43.640159Z","submitted_at":"2025-01-16T04:53:29Z","title":"LAVCap: LLM-based Audio-Visual Captioning using Optimal Transport","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:24.031857Z"},"links":{"citing_paper":"/paper/2501.09291"},"observation_digest":"sha256:d99de7c2344733c25b5f15b6529f98719949de6726989ec17516f708e45c5f99","observation_id":"9621f7f6-81f4-490d-94dd-4b96363286fc","resolution":{"observed_at":"2026-08-10T20:14:24.468036Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:24.450526Z","title":"WavCaps: A chatgpt-assisted weakly-labelled audio captioning dataset for audio-language multimodal research,","venue":null,"work_id":"7893758a-9a95-4d6d-ab68-6745e386d394","year":2024},"citing_paper":{"arxiv_id":"2501.09291","last_updated":"2025-03-15T12:38:50Z","snapshot_observed_at":"2026-08-16T11:13:43.640159Z","submitted_at":"2025-01-16T04:53:29Z","title":"LAVCap: LLM-based Audio-Visual Captioning using Optimal Transport","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:24.035951Z"},"links":{"citing_paper":"/paper/2501.09291"},"observation_digest":"sha256:da5bdd90d99c3fe805c12a8f317538dee069a6ac020dc25e05dbc1c3c89c68fd","observation_id":"ae10686b-e2e8-4229-8ca5-2bab65629e0b","resolution":{"observed_at":"2026-08-10T20:14:24.455187Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:24.438465Z","title":"CoNeTTE: An efficient audio captioning system leveraging multiple datasets with task embedding,","venue":null,"work_id":"3e63b777-253c-4291-a5f8-2b15a5fe9d6b","year":2024},"citing_paper":{"arxiv_id":"2501.09291","last_updated":"2025-03-15T12:38:50Z","snapshot_observed_at":"2026-08-16T11:13:43.640159Z","submitted_at":"2025-01-16T04:53:29Z","title":"LAVCap: LLM-based Audio-Visual Captioning using Optimal Transport","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:24.040874Z"},"links":{"citing_paper":"/paper/2501.09291"},"observation_digest":"sha256:03d0ceed3d90b5dbac7cfeca1a33641379c642e134434bfec7e0601037f72526","observation_id":"b01b7139-f288-4b6d-a93b-f9f57812430e","resolution":{"observed_at":"2026-08-10T20:14:24.442774Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:24.425157Z","title":"Enhancing automated audio captioning via large language models with optimized audio encoding,","venue":null,"work_id":"d12a0408-46a8-4dd1-add0-3159f748e264","year":2024},"citing_paper":{"arxiv_id":"2501.09291","last_updated":"2025-03-15T12:38:50Z","snapshot_observed_at":"2026-08-16T11:13:43.640159Z","submitted_at":"2025-01-16T04:53:29Z","title":"LAVCap: LLM-based Audio-Visual Captioning using Optimal Transport","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:24.044831Z"},"links":{"citing_paper":"/paper/2501.09291"},"observation_digest":"sha256:c96cbad86f05ddefb764f4cb8bcaf56c046dc3abe2c2f84094c4ba07746cc99d","observation_id":"e2691a3a-ff89-4aed-b951-b25914a5f984","resolution":{"observed_at":"2026-08-10T20:14:24.429866Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19388","last_updated":"2025-04-16T17:40:22Z","snapshot_observed_at":"2026-08-16T13:38:58.476435Z","submitted_at":"2024-06-27T17:58:54Z","title":"Taming Data and Transformers for Audio Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19388","snapshot_observed_at":"2026-08-10T20:14:24.048855Z","title":"Taming data and transformers for audio generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.09291","last_updated":"2025-03-15T12:38:50Z","snapshot_observed_at":"2026-08-16T11:13:43.640159Z","submitted_at":"2025-01-16T04:53:29Z","title":"LAVCap: LLM-based Audio-Visual Captioning using Optimal Transport","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:24.048855Z"},"links":{"cited_paper":"/paper/2406.19388","citing_paper":"/paper/2501.09291"},"observation_digest":"sha256:95a90a17beebe3e060af95f428eeaa39b1a616eefdb2066837dbaef30284cbe7","observation_id":"6c6ef354-ca3f-4c70-aeca-c4fac11cd4bd","resolution":{"observed_at":"2026-08-10T20:14:24.048855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:24.053038Z","title":"PANNs: Large-scale pretrained audio neural networks for audio pattern recognition,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.09291","last_updated":"2025-03-15T12:38:50Z","snapshot_observed_at":"2026-08-16T11:13:43.640159Z","submitted_at":"2025-01-16T04:53:29Z","title":"LAVCap: LLM-based Audio-Visual Captioning using Optimal Transport","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:24.053038Z"},"links":{"citing_paper":"/paper/2501.09291"},"observation_digest":"sha256:2c1c3b8f583760381a588882dbb4f69d22623e9d0652677ab6fabd0cf365f9f4","observation_id":"0d03cd14-c60b-4395-a873-daea2797556e","resolution":{"observed_at":"2026-08-10T20:14:24.053038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:24.405271Z","title":"HTS-AT: A hierarchical token-semantic audio transformer for sound classification and detection,","venue":null,"work_id":"9637a9b9-7928-4fce-bd15-ed5a7bef1908","year":2022},"citing_paper":{"arxiv_id":"2501.09291","last_updated":"2025-03-15T12:38:50Z","snapshot_observed_at":"2026-08-16T11:13:43.640159Z","submitted_at":"2025-01-16T04:53:29Z","title":"LAVCap: LLM-based Audio-Visual Captioning using Optimal Transport","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:24.057056Z"},"links":{"citing_paper":"/paper/2501.09291"},"observation_digest":"sha256:92c5bcd2f48a79203b23f519fa0fd059df4045dbee7831bf071d1c66b82a7576","observation_id":"89d09ab9-55c1-4355-b652-a4f2d93695c6","resolution":{"observed_at":"2026-08-10T20:14:24.409623Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:24.391759Z","title":"BEATs: audio pre-training with acoustic tokenizers,","venue":null,"work_id":"b6e66079-6d94-45cc-b5de-a25d301a78f8","year":2023},"citing_paper":{"arxiv_id":"2501.09291","last_updated":"2025-03-15T12:38:50Z","snapshot_observed_at":"2026-08-16T11:13:43.640159Z","submitted_at":"2025-01-16T04:53:29Z","title":"LAVCap: LLM-based Audio-Visual Captioning using Optimal Transport","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:24.061563Z"},"links":{"citing_paper":"/paper/2501.09291"},"observation_digest":"sha256:01f40c8b711a92e8e8a902eb8657ff1e66ea299455dc1edad75eabc1042e1df2","observation_id":"e4a00442-0441-47f8-9afc-728d2209803f","resolution":{"observed_at":"2026-08-10T20:14:24.396071Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:24.379237Z","title":"CLAP: Learning audio concepts from natural language supervision,","venue":null,"work_id":"fd52e9e0-9e07-4088-babf-1ab4dda9e6e5","year":2023},"citing_paper":{"arxiv_id":"2501.09291","last_updated":"2025-03-15T12:38:50Z","snapshot_observed_at":"2026-08-16T11:13:43.640159Z","submitted_at":"2025-01-16T04:53:29Z","title":"LAVCap: LLM-based Audio-Visual Captioning using Optimal Transport","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:24.066683Z"},"links":{"citing_paper":"/paper/2501.09291"},"observation_digest":"sha256:640102b46fe6fd48bd32d1d698cbd513dcefa866dd1d727245ab32be42871e96","observation_id":"83f552bd-4d01-430b-8a95-2866f08659d6","resolution":{"observed_at":"2026-08-10T20:14:24.383716Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:24.070730Z","title":"High fidelity neural audio compression,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.09291","last_updated":"2025-03-15T12:38:50Z","snapshot_observed_at":"2026-08-16T11:13:43.640159Z","submitted_at":"2025-01-16T04:53:29Z","title":"LAVCap: LLM-based Audio-Visual Captioning using Optimal Transport","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:24.070730Z"},"links":{"citing_paper":"/paper/2501.09291"},"observation_digest":"sha256:8a81e7fb0fd1f7afa2e65680c80f12f3b6db90b725d7ab97b59ae2ff03e767b3","observation_id":"cebe1ac3-e3e3-44c6-af8a-aa7f1899a16f","resolution":{"observed_at":"2026-08-10T20:14:24.070730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:24.359626Z","title":"Visually-aware audio captioning with adaptive audio-visual attention,","venue":null,"work_id":"beb43127-d0f9-41a4-a210-75fa13c66993","year":2023},"citing_paper":{"arxiv_id":"2501.09291","last_updated":"2025-03-15T12:38:50Z","snapshot_observed_at":"2026-08-16T11:13:43.640159Z","submitted_at":"2025-01-16T04:53:29Z","title":"LAVCap: LLM-based Audio-Visual Captioning using Optimal Transport","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:24.075092Z"},"links":{"citing_paper":"/paper/2501.09291"},"observation_digest":"sha256:a695ae5671d740abfd9fed193587b18f0b4db3f96a8ee724a66b738a8fc31557","observation_id":"2d913290-c2ef-4d03-9b0a-ef96f4d4f64f","resolution":{"observed_at":"2026-08-10T20:14:24.364291Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:24.347864Z","title":"A VCap: Leveraging audio-visual features as text tokens for captioning,","venue":null,"work_id":"8ec5729f-5183-404d-8fbe-855dffc2340d","year":2024},"citing_paper":{"arxiv_id":"2501.09291","last_updated":"2025-03-15T12:38:50Z","snapshot_observed_at":"2026-08-16T11:13:43.640159Z","submitted_at":"2025-01-16T04:53:29Z","title":"LAVCap: LLM-based Audio-Visual Captioning using Optimal Transport","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:24.079355Z"},"links":{"citing_paper":"/paper/2501.09291"},"observation_digest":"sha256:41b4a76860a895f2bb69878dcc0b53aab18400327695e566d987647092e89810","observation_id":"20f54658-b9e8-4559-ad74-a81046bc808d","resolution":{"observed_at":"2026-08-10T20:14:24.351991Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:24.334360Z","title":"Multi- granularity correspondence learning from long-term noisy videos,","venue":null,"work_id":"370d98e2-2cd8-45da-b823-b3341e37444a","year":2024},"citing_paper":{"arxiv_id":"2501.09291","last_updated":"2025-03-15T12:38:50Z","snapshot_observed_at":"2026-08-16T11:13:43.640159Z","submitted_at":"2025-01-16T04:53:29Z","title":"LAVCap: LLM-based Audio-Visual Captioning using Optimal Transport","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:24.083380Z"},"links":{"citing_paper":"/paper/2501.09291"},"observation_digest":"sha256:a93eecab5537323da080e77a1d38affa2a9e466d32ea1d56da6e4275bd872057","observation_id":"a2a76d17-790f-49e5-b596-0c17522e13c7","resolution":{"observed_at":"2026-08-10T20:14:24.339844Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:24.322315Z","title":"Sinkhorn distances: Lightspeed computation of optimal transport,","venue":null,"work_id":"9ee18088-8b5e-4479-a771-02109a3e6360","year":2013},"citing_paper":{"arxiv_id":"2501.09291","last_updated":"2025-03-15T12:38:50Z","snapshot_observed_at":"2026-08-16T11:13:43.640159Z","submitted_at":"2025-01-16T04:53:29Z","title":"LAVCap: LLM-based Audio-Visual Captioning using Optimal Transport","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:24.087468Z"},"links":{"citing_paper":"/paper/2501.09291"},"observation_digest":"sha256:33fcacbb77e9f49fdd643bd6dfe519e2a050009d38957aa04b43e24a85612723","observation_id":"38cf3bb0-f72c-4514-9954-08c3b7a92adf","resolution":{"observed_at":"2026-08-10T20:14:24.326475Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:24.309683Z","title":"Audiocaps: Generating captions for audios in the wild,","venue":null,"work_id":"85eacea7-96cf-48c3-9ab9-55198c97e6cb","year":2019},"citing_paper":{"arxiv_id":"2501.09291","last_updated":"2025-03-15T12:38:50Z","snapshot_observed_at":"2026-08-16T11:13:43.640159Z","submitted_at":"2025-01-16T04:53:29Z","title":"LAVCap: LLM-based Audio-Visual Captioning using Optimal Transport","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:24.091698Z"},"links":{"citing_paper":"/paper/2501.09291"},"observation_digest":"sha256:c9790ee780456dae80a07544bd676e30e35f2c2b79d5903c3611b4e833e4bfd8","observation_id":"269af917-aa57-4f67-9df1-902d0b927e1a","resolution":{"observed_at":"2026-08-10T20:14:24.314167Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:24.296863Z","title":"Ced: Consistent ensemble distillation for audio tagging,","venue":null,"work_id":"2f4f3366-da2f-4cf2-bb71-de77ce5299fc","year":2024},"citing_paper":{"arxiv_id":"2501.09291","last_updated":"2025-03-15T12:38:50Z","snapshot_observed_at":"2026-08-16T11:13:43.640159Z","submitted_at":"2025-01-16T04:53:29Z","title":"LAVCap: LLM-based Audio-Visual Captioning using Optimal Transport","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:24.095613Z"},"links":{"citing_paper":"/paper/2501.09291"},"observation_digest":"sha256:532093907ca8b155cdce91b401052bd2d8cd89faba1331847a21cb81b1924fc0","observation_id":"71c883f2-b2f6-41b9-ac34-2e8ed4e40a38","resolution":{"observed_at":"2026-08-10T20:14:24.300965Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:24.284609Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":"82362ded-8c2e-4c98-9b9c-0500dac644d4","year":2021},"citing_paper":{"arxiv_id":"2501.09291","last_updated":"2025-03-15T12:38:50Z","snapshot_observed_at":"2026-08-16T11:13:43.640159Z","submitted_at":"2025-01-16T04:53:29Z","title":"LAVCap: LLM-based Audio-Visual Captioning using Optimal Transport","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:24.099959Z"},"links":{"citing_paper":"/paper/2501.09291"},"observation_digest":"sha256:3170dc02374156bd576af147bef27cb7275cef3ac538c95ad5a45fff5ed058ce","observation_id":"b83eef74-2a62-440d-b115-ef3a3b8508a3","resolution":{"observed_at":"2026-08-10T20:14:24.288877Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-10T20:14:24.103831Z","title":"Llama 2: Open foundation and fine-tuned chat models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.09291","last_updated":"2025-03-15T12:38:50Z","snapshot_observed_at":"2026-08-16T11:13:43.640159Z","submitted_at":"2025-01-16T04:53:29Z","title":"LAVCap: LLM-based Audio-Visual Captioning using Optimal Transport","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:24.103831Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2501.09291"},"observation_digest":"sha256:13555f1ce5a338ca01e9b008d72bc98110f3b3f2f92a32699c11b1b8bbae50ea","observation_id":"781e6ef9-06a4-4bb9-9206-06a07a0c6bdc","resolution":{"observed_at":"2026-08-10T20:14:24.103831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:24.272142Z","title":"LoRA: Low-rank adaptation of large language models,","venue":null,"work_id":"cea2cf8f-9779-4a52-85ae-41f98afc0d36","year":2022},"citing_paper":{"arxiv_id":"2501.09291","last_updated":"2025-03-15T12:38:50Z","snapshot_observed_at":"2026-08-16T11:13:43.640159Z","submitted_at":"2025-01-16T04:53:29Z","title":"LAVCap: LLM-based Audio-Visual Captioning using Optimal Transport","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:24.107764Z"},"links":{"citing_paper":"/paper/2501.09291"},"observation_digest":"sha256:eba75aa3c11cf9100a971d8cf492b218de37170960e0527b1becc7aa009e1c36","observation_id":"21a33c6f-8470-497e-96d9-64aeb76e88aa","resolution":{"observed_at":"2026-08-10T20:14:24.276833Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:24.257403Z","title":"BLEU: a method for automatic evaluation of machine translation,","venue":null,"work_id":"a29a9692-6049-46e0-be98-9ef692ecff2c","year":2002},"citing_paper":{"arxiv_id":"2501.09291","last_updated":"2025-03-15T12:38:50Z","snapshot_observed_at":"2026-08-16T11:13:43.640159Z","submitted_at":"2025-01-16T04:53:29Z","title":"LAVCap: LLM-based Audio-Visual Captioning using Optimal Transport","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:24.111830Z"},"links":{"citing_paper":"/paper/2501.09291"},"observation_digest":"sha256:659b0c9436e10f77bf3070751c8642b783137e978520dcb1ef7af0cc93b247f2","observation_id":"47c7585b-c4c7-48d1-b148-a1a3f3ce8dc4","resolution":{"observed_at":"2026-08-10T20:14:24.262313Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:24.243503Z","title":"ROUGE: A package for automatic evaluation of summaries,","venue":null,"work_id":"168f5a9a-77ba-4ae3-85db-420cc585dfc5","year":2004},"citing_paper":{"arxiv_id":"2501.09291","last_updated":"2025-03-15T12:38:50Z","snapshot_observed_at":"2026-08-16T11:13:43.640159Z","submitted_at":"2025-01-16T04:53:29Z","title":"LAVCap: LLM-based Audio-Visual Captioning using Optimal Transport","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:24.115542Z"},"links":{"citing_paper":"/paper/2501.09291"},"observation_digest":"sha256:e274c3c913fffb16fc886483cbcca27d00b33f9d405aef22dd08a05db8f0ef94","observation_id":"e517c3d9-f19f-419c-b435-54096f732b1a","resolution":{"observed_at":"2026-08-10T20:14:24.247537Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:24.230347Z","title":"METEOR: An automatic metric for MT evaluation with improved correlation with human judgments,","venue":null,"work_id":"340c978c-b3a7-4bb4-97f0-5af9e6940f5e","year":2005},"citing_paper":{"arxiv_id":"2501.09291","last_updated":"2025-03-15T12:38:50Z","snapshot_observed_at":"2026-08-16T11:13:43.640159Z","submitted_at":"2025-01-16T04:53:29Z","title":"LAVCap: LLM-based Audio-Visual Captioning using Optimal Transport","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:24.119327Z"},"links":{"citing_paper":"/paper/2501.09291"},"observation_digest":"sha256:5a8ec27e8a2f3bec6800d34e2e4ede4bc2594cd2a9ebcc8aa804db9ecbffb912","observation_id":"61bcdc4c-f0aa-4568-8553-6bbc82145c63","resolution":{"observed_at":"2026-08-10T20:14:24.234956Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:24.217428Z","title":"Cider: Consensus- based image description evaluation,","venue":null,"work_id":"39bb22e8-7adf-41f7-a3b2-222a57845d4e","year":2015},"citing_paper":{"arxiv_id":"2501.09291","last_updated":"2025-03-15T12:38:50Z","snapshot_observed_at":"2026-08-16T11:13:43.640159Z","submitted_at":"2025-01-16T04:53:29Z","title":"LAVCap: LLM-based Audio-Visual Captioning using Optimal Transport","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:24.123054Z"},"links":{"citing_paper":"/paper/2501.09291"},"observation_digest":"sha256:e68ccb4bdcc7cca4f0c476d06b54de49025bbe4526f043e30a147b3d939c9693","observation_id":"c0986ccc-04ee-4e0d-8961-076bf4d492bc","resolution":{"observed_at":"2026-08-10T20:14:24.222066Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:24.205181Z","title":"Spice: Semantic propositional image caption evaluation,","venue":null,"work_id":"437ee9f3-8fc6-4823-aeda-6b74e7afd07b","year":2016},"citing_paper":{"arxiv_id":"2501.09291","last_updated":"2025-03-15T12:38:50Z","snapshot_observed_at":"2026-08-16T11:13:43.640159Z","submitted_at":"2025-01-16T04:53:29Z","title":"LAVCap: LLM-based Audio-Visual Captioning using Optimal Transport","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:24.127000Z"},"links":{"citing_paper":"/paper/2501.09291"},"observation_digest":"sha256:ce920cda5cb27a19add49dc9bae74b9f228f39e5be5e02240b8ec220d92641f1","observation_id":"1799ba48-c63a-4819-93bd-47d93c37fe01","resolution":{"observed_at":"2026-08-10T20:14:24.209191Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:24.190108Z","title":"Improved image captioning via policy gradient optimization of spider,","venue":null,"work_id":"733c9ba0-4e55-42fd-92c9-59440fb09f91","year":2017},"citing_paper":{"arxiv_id":"2501.09291","last_updated":"2025-03-15T12:38:50Z","snapshot_observed_at":"2026-08-16T11:13:43.640159Z","submitted_at":"2025-01-16T04:53:29Z","title":"LAVCap: LLM-based Audio-Visual Captioning using Optimal Transport","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:24.131196Z"},"links":{"citing_paper":"/paper/2501.09291"},"observation_digest":"sha256:5de87ee80c79a29c9ebde6d60e0b017d07a8eeb884d84f0c15cf74088201e5b7","observation_id":"f919a529-ed1e-472e-85d8-a5fd2322b9ad","resolution":{"observed_at":"2026-08-10T20:14:24.196050Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2501.09291","last_updated":"2025-03-15T12:38:50Z","latest_version":2,"primary_category":"cs.MM","snapshot_observed_at":"2026-08-16T11:13:43.640159Z","submitted_at":"2025-01-16T04:53:29Z","title":"LAVCap: LLM-based Audio-Visual Captioning using Optimal Transport"},"reference_resolution":{"displayed":29,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":4,"verified_exact":0,"verified_fuzzy":25},"total_outbound_references":29},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 29 of 29 outbound references and 4 inbound Pith citation observations for arXiv:2501.09291."}