{"as_of":"2026-08-13T01:03:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:46538a27d069ba03bb9aad84c54404c9b159df4e805241ea95952bd20b30e2e6","coverage":[{"denominator":62,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":62,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T10:46:23.625101Z","state":"measured"},{"denominator":66,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":66,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T14:36:19.810821Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T00:23:19.246908Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.18953","last_updated":"2024-11-28T06:50:13Z","snapshot_observed_at":"2026-08-12T10:40:08.789146Z","submitted_at":"2024-11-28T06:50:13Z","title":"AudioSetCaps: An Enriched Audio-Caption Dataset using Automated Generation Pipeline with Large Audio and Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.18953","snapshot_observed_at":"2026-08-10T14:36:19.810821Z","title":"Audiosetcaps: An enriched audio-caption dataset using automated generation pipeline with large audio and language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15177","last_updated":"2026-07-03T16:46:09Z","snapshot_observed_at":"2026-08-10T17:21:32.264725Z","submitted_at":"2025-01-25T11:15:06Z","title":"Audio-Language Models for Audio-Centric Tasks: A Systematic Survey","version":3},"reference_index":137,"source":"pdf_text","source_observed_at":"2026-08-10T14:36:19.810821Z"},"links":{"cited_paper":"/paper/2411.18953","citing_paper":"/paper/2501.15177"},"observation_digest":"sha256:b8b3aab25a4da55bfa8871e0dbedb00406bbbe1812449c342feb2b3a8856497a","observation_id":"e0dc5f4c-f6ea-4aff-9abf-fa28969b7b5a","resolution":{"observed_at":"2026-08-10T14:36:19.810821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.18953","last_updated":"2024-11-28T06:50:13Z","snapshot_observed_at":"2026-08-12T10:40:08.789146Z","submitted_at":"2024-11-28T06:50:13Z","title":"AudioSetCaps: An Enriched Audio-Caption Dataset using Automated Generation Pipeline with Large Audio and Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.18953","snapshot_observed_at":"2026-08-07T18:32:13.836268Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10362","last_updated":"2025-05-18T16:25:19Z","snapshot_observed_at":"2026-08-09T04:24:18.854597Z","submitted_at":"2025-02-14T18:42:25Z","title":"CLaMP 3: Universal Music Information Retrieval Across Unaligned Modalities and Unseen Languages","version":3},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T18:32:13.836268Z"},"links":{"cited_paper":"/paper/2411.18953","citing_paper":"/paper/2502.10362"},"observation_digest":"sha256:fbf73f14357dcd74cce3437a4bc9cbdd11b86bf3b8fa0f12485d1ec5971409c0","observation_id":"11c2d147-4f94-4224-a045-a88b69bd12b0","resolution":{"observed_at":"2026-08-07T18:32:13.836268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.18953","last_updated":"2024-11-28T06:50:13Z","snapshot_observed_at":"2026-08-12T10:40:08.789146Z","submitted_at":"2024-11-28T06:50:13Z","title":"AudioSetCaps: An Enriched Audio-Caption Dataset using Automated Generation Pipeline with Large Audio and Language Models","version":1},"cited_work":{"arxiv_id":"2411.18953","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.18953","snapshot_observed_at":"2026-08-07T00:23:19.246908Z","title":"AudioSetCaps: An Enriched Audio-Caption Dataset using Automated Generation Pipeline with Large Audio and Language Models","venue":"eess.AS","work_id":"0fed9bee-d6f1-498a-be0d-6fe82dafded4","year":2024},"citing_paper":{"arxiv_id":"2506.14445","last_updated":"2025-06-17T12:10:19Z","snapshot_observed_at":"2026-08-07T00:15:30.364862Z","submitted_at":"2025-06-17T12:10:19Z","title":"Vela: Scalable Embeddings with Voice Large Language Models for Multimodal Retrieval","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:16.841565Z"},"links":{"cited_paper":"/paper/2411.18953","citing_paper":"/paper/2506.14445"},"observation_digest":"sha256:71964ccf87372df63ac37160b434c6fe7685408b9dceb4d82d0826043991f10e","observation_id":"d4795b6c-b14e-4649-ba61-c559c05a85d5","resolution":{"observed_at":"2026-08-07T00:23:19.253506Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.18953","last_updated":"2024-11-28T06:50:13Z","snapshot_observed_at":"2026-08-12T10:40:08.789146Z","submitted_at":"2024-11-28T06:50:13Z","title":"AudioSetCaps: An Enriched Audio-Caption Dataset using Automated Generation Pipeline with Large Audio and Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.18953","snapshot_observed_at":"2026-08-01T14:46:34.886995Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.18666","last_updated":"2026-07-21T03:25:34Z","snapshot_observed_at":"2026-08-06T07:56:47.796949Z","submitted_at":"2026-07-21T03:25:34Z","title":"Fusion Embedding: A Unified Embedding Space for Text, Image, Video, and Audio","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-01T14:46:34.886995Z"},"links":{"cited_paper":"/paper/2411.18953","citing_paper":"/paper/2607.18666"},"observation_digest":"sha256:bc2661f5b59c91d2d39aec0bcc0c43d7ce1127c76ffeb9b9cd69ed04efdae6b8","observation_id":"03c50d2d-29da-42ee-90ed-d6ba7bb606b0","resolution":{"observed_at":"2026-08-01T14:46:34.886995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2411.18953/citation-record","integrity":"/paper/2411.18953/integrity","json":"/paper/2411.18953/citation-record.json","paper":"/paper/2411.18953"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:46:24.043964Z","title":"WavCaps: A chatgpt-assisted weakly-labelled audio captioning dataset for audio-language multimodal research,","venue":null,"work_id":"ba3758a8-f14e-4cae-9017-a7eced825036","year":2024},"citing_paper":{"arxiv_id":"2411.18953","last_updated":"2024-11-28T06:50:13Z","snapshot_observed_at":"2026-08-12T10:40:08.789146Z","submitted_at":"2024-11-28T06:50:13Z","title":"AudioSetCaps: An Enriched Audio-Caption Dataset using Automated Generation Pipeline with Large Audio and Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T10:46:23.472444Z"},"links":{"citing_paper":"/paper/2411.18953"},"observation_digest":"sha256:9ff8d488d662c0ca4432f661f618928f8b6bf7054d2ab858640bec34ba1fbaaa","observation_id":"5412e09b-4750-44a0-81b6-866377de6ce9","resolution":{"observed_at":"2026-08-12T10:46:24.046844Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:46:24.036375Z","title":"Pengi: An audio language model for audio tasks,","venue":null,"work_id":"90c90f74-ac8d-408c-8ca8-3b0049d3f419","year":2023},"citing_paper":{"arxiv_id":"2411.18953","last_updated":"2024-11-28T06:50:13Z","snapshot_observed_at":"2026-08-12T10:40:08.789146Z","submitted_at":"2024-11-28T06:50:13Z","title":"AudioSetCaps: An Enriched Audio-Caption Dataset using Automated Generation Pipeline with Large Audio and Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T10:46:23.475396Z"},"links":{"citing_paper":"/paper/2411.18953"},"observation_digest":"sha256:1f5d616a78478e04628a407768bb10d6a355077de3a51254127bfdf8baa80880","observation_id":"fda6a710-5d53-4d4f-8cb7-a5448786865f","resolution":{"observed_at":"2026-08-12T10:46:24.039573Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.18223","last_updated":"2026-03-18T05:34:39Z","snapshot_observed_at":"2026-08-06T23:27:24.356320Z","submitted_at":"2023-03-31T17:28:46Z","title":"A Survey of Large Language Models","version":19},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.18223","snapshot_observed_at":"2026-08-12T10:46:23.477868Z","title":"A survey of large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18953","last_updated":"2024-11-28T06:50:13Z","snapshot_observed_at":"2026-08-12T10:40:08.789146Z","submitted_at":"2024-11-28T06:50:13Z","title":"AudioSetCaps: An Enriched Audio-Caption Dataset using Automated Generation Pipeline with Large Audio and Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T10:46:23.477868Z"},"links":{"cited_paper":"/paper/2303.18223","citing_paper":"/paper/2411.18953"},"observation_digest":"sha256:dd5a787e15c413f9adc59c677a5d4538c678d7bcb5deacc16d861f85bcdbe6aa","observation_id":"1cce0362-de32-4d59-aae4-00b756525d12","resolution":{"observed_at":"2026-08-12T10:46:23.477868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:46:24.029085Z","title":"Prompting large language models with speech recognition abilities,","venue":null,"work_id":"b217cdaa-a787-40fb-951c-26d24ec31729","year":2024},"citing_paper":{"arxiv_id":"2411.18953","last_updated":"2024-11-28T06:50:13Z","snapshot_observed_at":"2026-08-12T10:40:08.789146Z","submitted_at":"2024-11-28T06:50:13Z","title":"AudioSetCaps: An Enriched Audio-Caption Dataset using Automated Generation Pipeline with Large Audio and Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T10:46:23.481022Z"},"links":{"citing_paper":"/paper/2411.18953"},"observation_digest":"sha256:57dd4867d486674a7959015aa24eb7529e0a8631b841e9c2644a4af87a882a38","observation_id":"5f309895-9776-45e8-bca3-ad3d57ba8667","resolution":{"observed_at":"2026-08-12T10:46:24.031909Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:46:24.021291Z","title":"AudioLDM: Text-to-audio generation with latent diffusion models,","venue":null,"work_id":"fcdacf0d-eaad-4da8-bc27-dc468ca81c9e","year":2023},"citing_paper":{"arxiv_id":"2411.18953","last_updated":"2024-11-28T06:50:13Z","snapshot_observed_at":"2026-08-12T10:40:08.789146Z","submitted_at":"2024-11-28T06:50:13Z","title":"AudioSetCaps: An Enriched Audio-Caption Dataset using Automated Generation Pipeline with Large Audio and Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T10:46:23.483625Z"},"links":{"citing_paper":"/paper/2411.18953"},"observation_digest":"sha256:ff9022b3a7f181bb18307e67de111543f0226b6e52ebbf26c338d1bea0dd6fb6","observation_id":"1c6c905b-d0bd-4504-827b-2fdac303ae4e","resolution":{"observed_at":"2026-08-12T10:46:24.024571Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:46:23.486192Z","title":"AudioLDM 2: Learning holistic audio generation with self-supervised pretraining,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18953","last_updated":"2024-11-28T06:50:13Z","snapshot_observed_at":"2026-08-12T10:40:08.789146Z","submitted_at":"2024-11-28T06:50:13Z","title":"AudioSetCaps: An Enriched Audio-Caption Dataset using Automated Generation Pipeline with Large Audio and Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T10:46:23.486192Z"},"links":{"citing_paper":"/paper/2411.18953"},"observation_digest":"sha256:da776ee5d8b8395dd6d4f7d9bbe7311bc819f6e723196a0e8f484c590a0e6c98","observation_id":"6111ccf1-dcdc-4d26-bb53-b98f14742a81","resolution":{"observed_at":"2026-08-12T10:46:23.486192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:46:24.010701Z","title":"Audio retrieval with natural language queries: A benchmark study,","venue":null,"work_id":"6b6ca594-7e0d-4d62-a11f-82f58111f9a4","year":2022},"citing_paper":{"arxiv_id":"2411.18953","last_updated":"2024-11-28T06:50:13Z","snapshot_observed_at":"2026-08-12T10:40:08.789146Z","submitted_at":"2024-11-28T06:50:13Z","title":"AudioSetCaps: An Enriched Audio-Caption Dataset using Automated Generation Pipeline with Large Audio and Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T10:46:23.488951Z"},"links":{"citing_paper":"/paper/2411.18953"},"observation_digest":"sha256:ad2c6b356633272585d6a8766507e4c2eb76add762e33783e26d41825346f872","observation_id":"be342558-9bb6-4582-9953-923f192bc141","resolution":{"observed_at":"2026-08-12T10:46:24.013342Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:46:24.004132Z","title":"Audiolog: LLMs-powered long audio logging with hybrid token- semantic contrastive learning,","venue":null,"work_id":"ed63dc2e-e58e-483d-95f8-8598cad1caaf","year":2024},"citing_paper":{"arxiv_id":"2411.18953","last_updated":"2024-11-28T06:50:13Z","snapshot_observed_at":"2026-08-12T10:40:08.789146Z","submitted_at":"2024-11-28T06:50:13Z","title":"AudioSetCaps: An Enriched Audio-Caption Dataset using Automated Generation Pipeline with Large Audio and Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T10:46:23.491426Z"},"links":{"citing_paper":"/paper/2411.18953"},"observation_digest":"sha256:9ecad3f0464d93c7c9785d487cdeb601e27f3027a6831f8c872589dc1661b892","observation_id":"153faeac-14dd-41d7-907e-b1f231193a76","resolution":{"observed_at":"2026-08-12T10:46:24.006758Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.07729","last_updated":"2024-07-26T06:30:47Z","snapshot_observed_at":"2026-08-06T03:59:19.956442Z","submitted_at":"2024-02-12T15:41:22Z","title":"AIR-Bench: Benchmarking Large Audio-Language Models via Generative Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.07729","snapshot_observed_at":"2026-08-12T10:46:23.493650Z","title":"AIR-Bench: Benchmarking large audio-language models via generative comprehension,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18953","last_updated":"2024-11-28T06:50:13Z","snapshot_observed_at":"2026-08-12T10:40:08.789146Z","submitted_at":"2024-11-28T06:50:13Z","title":"AudioSetCaps: An Enriched Audio-Caption Dataset using Automated Generation Pipeline with Large Audio and Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T10:46:23.493650Z"},"links":{"cited_paper":"/paper/2402.07729","citing_paper":"/paper/2411.18953"},"observation_digest":"sha256:bda0a87e452995b68eddee9b259118547cc3b75efb102498cb36271dd12981c8","observation_id":"bb9a2217-7c62-492d-87ad-1945a3870248","resolution":{"observed_at":"2026-08-12T10:46:23.493650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12792","last_updated":"2023-09-22T01:44:46Z","snapshot_observed_at":"2026-08-08T14:04:39.691656Z","submitted_at":"2023-08-24T13:47:16Z","title":"Sparks of Large Audio Models: A Survey and Outlook","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12792","snapshot_observed_at":"2026-08-12T10:46:23.496448Z","title":"Sparks of large audio models: A survey and outlook,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18953","last_updated":"2024-11-28T06:50:13Z","snapshot_observed_at":"2026-08-12T10:40:08.789146Z","submitted_at":"2024-11-28T06:50:13Z","title":"AudioSetCaps: An Enriched Audio-Caption Dataset using Automated Generation Pipeline with Large Audio and Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T10:46:23.496448Z"},"links":{"cited_paper":"/paper/2308.12792","citing_paper":"/paper/2411.18953"},"observation_digest":"sha256:0515832dda5fc26233fc846f705625c0598fa5f8a95cf10e31d9a18c7b19c738","observation_id":"a4c3c30a-c2b8-40b7-8c22-efc1038db471","resolution":{"observed_at":"2026-08-12T10:46:23.496448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06947","last_updated":"2025-01-08T15:54:39Z","snapshot_observed_at":"2026-08-12T23:25:44.676749Z","submitted_at":"2024-07-09T15:23:35Z","title":"Audio-Language Datasets of Scenes and Events: A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.06947","snapshot_observed_at":"2026-08-12T10:46:23.499141Z","title":"Audio- language datasets of scenes and events: A survey,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18953","last_updated":"2024-11-28T06:50:13Z","snapshot_observed_at":"2026-08-12T10:40:08.789146Z","submitted_at":"2024-11-28T06:50:13Z","title":"AudioSetCaps: An Enriched Audio-Caption Dataset using Automated Generation Pipeline with Large Audio and Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T10:46:23.499141Z"},"links":{"cited_paper":"/paper/2407.06947","citing_paper":"/paper/2411.18953"},"observation_digest":"sha256:a4158257440b9854794b9f159bea52642350e15c1653c6e3bd68be839690736a","observation_id":"70798fde-685b-4eb8-8f9d-94e74084282b","resolution":{"observed_at":"2026-08-12T10:46:23.499141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:46:23.997444Z","title":"Large-scale contrastive language-audio pretraining with feature fusion and keyword-to-caption augmentation,","venue":null,"work_id":"039056ee-fe16-497a-ac60-9847ff01c59c","year":2023},"citing_paper":{"arxiv_id":"2411.18953","last_updated":"2024-11-28T06:50:13Z","snapshot_observed_at":"2026-08-12T10:40:08.789146Z","submitted_at":"2024-11-28T06:50:13Z","title":"AudioSetCaps: An Enriched Audio-Caption Dataset using Automated Generation Pipeline with Large Audio and Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T10:46:23.501922Z"},"links":{"citing_paper":"/paper/2411.18953"},"observation_digest":"sha256:68097160c76ef009220b55593b379f839d164bf8cbdca7f17cc72a706afa0aaa","observation_id":"4a4c5665-ff4c-4ec6-a60a-1029d8409f5d","resolution":{"observed_at":"2026-08-12T10:46:23.999997Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:46:23.990663Z","title":"CLAP learning audio concepts from natural language supervision,","venue":null,"work_id":"26817c9f-900b-4fd8-adde-481be353259c","year":2023},"citing_paper":{"arxiv_id":"2411.18953","last_updated":"2024-11-28T06:50:13Z","snapshot_observed_at":"2026-08-12T10:40:08.789146Z","submitted_at":"2024-11-28T06:50:13Z","title":"AudioSetCaps: An Enriched Audio-Caption Dataset using Automated Generation Pipeline with Large Audio and Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T10:46:23.504346Z"},"links":{"citing_paper":"/paper/2411.18953"},"observation_digest":"sha256:8f9eeccda30d36aa12bde850e0e6946367e607de8cb6eb4f3d67accbb0a89fd7","observation_id":"4d9f7c2f-491f-4c55-9202-38437eb3e36b","resolution":{"observed_at":"2026-08-12T10:46:23.993308Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12028","last_updated":"2024-10-15T19:57:37Z","snapshot_observed_at":"2026-08-12T22:22:23.514752Z","submitted_at":"2024-10-15T19:57:37Z","title":"EmotionCaps: Enhancing Audio Captioning Through Emotion-Augmented Data Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.12028","snapshot_observed_at":"2026-08-12T10:46:23.506748Z","title":"EmotionCaps: En- hancing audio captioning through emotion-augmented data generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18953","last_updated":"2024-11-28T06:50:13Z","snapshot_observed_at":"2026-08-12T10:40:08.789146Z","submitted_at":"2024-11-28T06:50:13Z","title":"AudioSetCaps: An Enriched Audio-Caption Dataset using Automated Generation Pipeline with Large Audio and Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T10:46:23.506748Z"},"links":{"cited_paper":"/paper/2410.12028","citing_paper":"/paper/2411.18953"},"observation_digest":"sha256:91b219c9989e760c836fff035d86721730dd9604d95ff2f98468a5885cb12857","observation_id":"c452f5cb-cd64-4616-8bbc-94f3eefa1848","resolution":{"observed_at":"2026-08-12T10:46:23.506748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:46:23.984029Z","title":"Auto-ACD: A large-scale dataset for audio-language representation learning,","venue":null,"work_id":"e8e2fc01-3d78-40e3-812e-ad479d13b167","year":2024},"citing_paper":{"arxiv_id":"2411.18953","last_updated":"2024-11-28T06:50:13Z","snapshot_observed_at":"2026-08-12T10:40:08.789146Z","submitted_at":"2024-11-28T06:50:13Z","title":"AudioSetCaps: An Enriched Audio-Caption Dataset using Automated Generation Pipeline with Large Audio and Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T10:46:23.509510Z"},"links":{"citing_paper":"/paper/2411.18953"},"observation_digest":"sha256:1a78779e0e120f5868c3f8c63133df386d79c4db418c646fe8a1b0fdbe23c2ff","observation_id":"8187fd51-6258-45fb-b0c5-6d2453337a10","resolution":{"observed_at":"2026-08-12T10:46:23.986628Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04416","last_updated":"2025-01-01T13:46:37Z","snapshot_observed_at":"2026-08-12T23:28:16.023992Z","submitted_at":"2024-07-05T11:07:13Z","title":"Sound-VECaps: Improving Audio Generation with Visual Enhanced Captions","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.04416","snapshot_observed_at":"2026-08-12T10:46:23.511855Z","title":"Improving audio generation with visual enhanced caption,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18953","last_updated":"2024-11-28T06:50:13Z","snapshot_observed_at":"2026-08-12T10:40:08.789146Z","submitted_at":"2024-11-28T06:50:13Z","title":"AudioSetCaps: An Enriched Audio-Caption Dataset using Automated Generation Pipeline with Large Audio and Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T10:46:23.511855Z"},"links":{"cited_paper":"/paper/2407.04416","citing_paper":"/paper/2411.18953"},"observation_digest":"sha256:40182940d1c2a3efcced1bd930ae08bfdee598db8093c9a379bd86e9dff97a63","observation_id":"9ee79af6-7f1e-4d93-86f8-67acf816466b","resolution":{"observed_at":"2026-08-12T10:46:23.511855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:46:23.977475Z","title":"Listen, think, and understand,","venue":null,"work_id":"39de1c71-1798-4786-9859-d8609f9c1283","year":2024},"citing_paper":{"arxiv_id":"2411.18953","last_updated":"2024-11-28T06:50:13Z","snapshot_observed_at":"2026-08-12T10:40:08.789146Z","submitted_at":"2024-11-28T06:50:13Z","title":"AudioSetCaps: An Enriched Audio-Caption Dataset using Automated Generation Pipeline with Large Audio and Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T10:46:23.514902Z"},"links":{"citing_paper":"/paper/2411.18953"},"observation_digest":"sha256:434d0d0e1fecdef595a07ced855f29dd6194c4d465c02ca52766f20fd71e9612","observation_id":"34df367f-df9c-4851-9380-ba9f08c25cf3","resolution":{"observed_at":"2026-08-12T10:46:23.980087Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:46:23.970868Z","title":"Joint audio and speech understanding,","venue":null,"work_id":"700a59c8-cdaf-4206-852a-b4bbe1ac39eb","year":2023},"citing_paper":{"arxiv_id":"2411.18953","last_updated":"2024-11-28T06:50:13Z","snapshot_observed_at":"2026-08-12T10:40:08.789146Z","submitted_at":"2024-11-28T06:50:13Z","title":"AudioSetCaps: An Enriched Audio-Caption Dataset using Automated Generation Pipeline with Large Audio and Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T10:46:23.517262Z"},"links":{"citing_paper":"/paper/2411.18953"},"observation_digest":"sha256:36b230fa49111fa8b46a503f694ce067e2f2084b524c913da6182edb62ccd2fa","observation_id":"37b41303-ac18-4d8b-9192-6c210e4aa9a3","resolution":{"observed_at":"2026-08-12T10:46:23.973414Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-08-07T10:17:55.688598Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-08-12T10:46:23.519965Z","title":"Qwen-Audio: Advancing universal audio understanding via unified large-scale audio-language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18953","last_updated":"2024-11-28T06:50:13Z","snapshot_observed_at":"2026-08-12T10:40:08.789146Z","submitted_at":"2024-11-28T06:50:13Z","title":"AudioSetCaps: An Enriched Audio-Caption Dataset using Automated Generation Pipeline with Large Audio and Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T10:46:23.519965Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2411.18953"},"observation_digest":"sha256:555b40bfc9d62ceaf305ec1b29f85cd5b03eb392c62f44e13f1dd2ad9e5b53e8","observation_id":"19b40a60-6b0d-4cc3-af48-8d55b32759de","resolution":{"observed_at":"2026-08-12T10:46:23.519965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:46:23.964011Z","title":"Audio Set: An ontology and human-labeled dataset for audio events,","venue":null,"work_id":"8e99c038-022b-46a0-b6e5-11fed28eabf7","year":2017},"citing_paper":{"arxiv_id":"2411.18953","last_updated":"2024-11-28T06:50:13Z","snapshot_observed_at":"2026-08-12T10:40:08.789146Z","submitted_at":"2024-11-28T06:50:13Z","title":"AudioSetCaps: An Enriched Audio-Caption Dataset using Automated Generation Pipeline with Large Audio and Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T10:46:23.522806Z"},"links":{"citing_paper":"/paper/2411.18953"},"observation_digest":"sha256:db5854515ce94e4a8cde0711a390c4859bb24f2fd54010166d9223dd7c4b35c2","observation_id":"7598409f-d473-4ab0-a335-7a5eab74f37c","resolution":{"observed_at":"2026-08-12T10:46:23.966618Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:46:23.956763Z","title":"AudioCaps: Generating captions for audios in the wild,","venue":null,"work_id":"ca786a5a-830e-4d19-b050-b05566b9659c","year":2019},"citing_paper":{"arxiv_id":"2411.18953","last_updated":"2024-11-28T06:50:13Z","snapshot_observed_at":"2026-08-12T10:40:08.789146Z","submitted_at":"2024-11-28T06:50:13Z","title":"AudioSetCaps: An Enriched Audio-Caption Dataset using Automated Generation Pipeline with Large Audio and Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T10:46:23.525231Z"},"links":{"citing_paper":"/paper/2411.18953"},"observation_digest":"sha256:2cf100fea2e5a50911dcd0c09be6093bea128f73603d81ef89e5170a9a6bed87","observation_id":"e2cd386a-2a6b-4180-ae51-059a378cbc13","resolution":{"observed_at":"2026-08-12T10:46:23.959760Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:46:23.949883Z","title":"Clotho: an audio captioning dataset,","venue":null,"work_id":"30cb1248-cd7b-4b6d-8056-a403cfec7f87","year":2020},"citing_paper":{"arxiv_id":"2411.18953","last_updated":"2024-11-28T06:50:13Z","snapshot_observed_at":"2026-08-12T10:40:08.789146Z","submitted_at":"2024-11-28T06:50:13Z","title":"AudioSetCaps: An Enriched Audio-Caption Dataset using Automated Generation Pipeline with Large Audio and Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T10:46:23.527709Z"},"links":{"citing_paper":"/paper/2411.18953"},"observation_digest":"sha256:0b1627192944ea33c2d50243ba0fa5bf91ed46cf7d583c791f82d18d985a6548","observation_id":"512e81bb-4ea8-4c8b-a1af-67228eb499cb","resolution":{"observed_at":"2026-08-12T10:46:23.952599Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:46:23.943078Z","title":"Diversity and bias in audio cap- tioning datasets,","venue":null,"work_id":"733cf483-f65e-4bf3-ab24-bed90738ce0d","year":2021},"citing_paper":{"arxiv_id":"2411.18953","last_updated":"2024-11-28T06:50:13Z","snapshot_observed_at":"2026-08-12T10:40:08.789146Z","submitted_at":"2024-11-28T06:50:13Z","title":"AudioSetCaps: An Enriched Audio-Caption Dataset using Automated Generation Pipeline with Large Audio and Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T10:46:23.530093Z"},"links":{"citing_paper":"/paper/2411.18953"},"observation_digest":"sha256:061c1accbf0f9a321ed3c053f2036ffde7d10bafba9e8e82e28a03488476d43c","observation_id":"8b82374e-64cf-48ec-ab1b-32d3124a7b24","resolution":{"observed_at":"2026-08-12T10:46:23.945778Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-12T10:46:23.532458Z","title":"Mistral 7B,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18953","last_updated":"2024-11-28T06:50:13Z","snapshot_observed_at":"2026-08-12T10:40:08.789146Z","submitted_at":"2024-11-28T06:50:13Z","title":"AudioSetCaps: An Enriched Audio-Caption Dataset using Automated Generation Pipeline with Large Audio and Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T10:46:23.532458Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2411.18953"},"observation_digest":"sha256:58009aaaa4e23128d95860d5b83b7b0a922aa459bc79eac69a877214f8e78400","observation_id":"6087bed5-8891-48d3-83c8-9abcdd51d92e","resolution":{"observed_at":"2026-08-12T10:46:23.532458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-12T10:46:23.535022Z","title":"Llama 2: Open foundation and fine-tuned chat models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18953","last_updated":"2024-11-28T06:50:13Z","snapshot_observed_at":"2026-08-12T10:40:08.789146Z","submitted_at":"2024-11-28T06:50:13Z","title":"AudioSetCaps: An Enriched Audio-Caption Dataset using Automated Generation Pipeline with Large Audio and Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T10:46:23.535022Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2411.18953"},"observation_digest":"sha256:d1affb95f7afdccd87e7cbedd5911adc37df765cd0fb38c1906c85a11eaf2f87","observation_id":"815b8c94-99bb-43bc-9be0-a4e1b8331bb4","resolution":{"observed_at":"2026-08-12T10:46:23.535022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-12T10:46:23.537522Z","title":"LLaMA: Open and efficient foundation language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18953","last_updated":"2024-11-28T06:50:13Z","snapshot_observed_at":"2026-08-12T10:40:08.789146Z","submitted_at":"2024-11-28T06:50:13Z","title":"AudioSetCaps: An Enriched Audio-Caption Dataset using Automated Generation Pipeline with Large Audio and Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T10:46:23.537522Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2411.18953"},"observation_digest":"sha256:ea013aa4d0baa72212b542ac34affc77194082d7a31a1e2a71158e1ad97984ce","observation_id":"edb17653-531d-4f7c-8172-406fa979f9af","resolution":{"observed_at":"2026-08-12T10:46:23.537522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04936","last_updated":"2025-01-06T00:55:27Z","snapshot_observed_at":"2026-08-12T23:27:47.894013Z","submitted_at":"2024-07-06T02:55:28Z","title":"A Reference-free Metric for Language-Queried Audio Source Separation using Contrastive Language-Audio Pretraining","version":2},"cited_work":{"arxiv_id":"2407.04936","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.04936","snapshot_observed_at":"2026-08-12T10:46:23.672170Z","title":"A Reference-free Metric for Language-Queried Audio Source Separation using Contrastive Language-Audio Pretraining","venue":"cs.SD","work_id":"28fd5691-1fc6-448a-b34c-7f253a679e0e","year":2024},"citing_paper":{"arxiv_id":"2411.18953","last_updated":"2024-11-28T06:50:13Z","snapshot_observed_at":"2026-08-12T10:40:08.789146Z","submitted_at":"2024-11-28T06:50:13Z","title":"AudioSetCaps: An Enriched Audio-Caption Dataset using Automated Generation Pipeline with Large Audio and Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T10:46:23.539990Z"},"links":{"cited_paper":"/paper/2407.04936","citing_paper":"/paper/2411.18953"},"observation_digest":"sha256:c78cc16d9a4cc178ab9d910267e8a24b7170754ca2ecee160ab7ad0326c87563","observation_id":"bd9fd254-456a-48c5-b36e-da9558d15077","resolution":{"observed_at":"2026-08-12T10:46:23.677547Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:46:23.936055Z","title":"AI Chains: Transparent and controllable human-ai interaction by chaining large language model prompts,","venue":null,"work_id":"03cbbb88-dfa1-4427-a965-1f3956553aad","year":2022},"citing_paper":{"arxiv_id":"2411.18953","last_updated":"2024-11-28T06:50:13Z","snapshot_observed_at":"2026-08-12T10:40:08.789146Z","submitted_at":"2024-11-28T06:50:13Z","title":"AudioSetCaps: An Enriched Audio-Caption Dataset using Automated Generation Pipeline with Large Audio and Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T10:46:23.542900Z"},"links":{"citing_paper":"/paper/2411.18953"},"observation_digest":"sha256:34cf988637d52312501b8d6a8301e3966681aa8a6f4412e9b7e186785a6a78ce","observation_id":"e2cf8811-6424-4476-8026-61e30ce46a5c","resolution":{"observed_at":"2026-08-12T10:46:23.938524Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:46:23.929289Z","title":"Classify first, and then extract: Prompt chaining technique for information extraction,","venue":null,"work_id":"2244e02b-6c8e-4520-92e8-53c98b96e5cb","year":2024},"citing_paper":{"arxiv_id":"2411.18953","last_updated":"2024-11-28T06:50:13Z","snapshot_observed_at":"2026-08-12T10:40:08.789146Z","submitted_at":"2024-11-28T06:50:13Z","title":"AudioSetCaps: An Enriched Audio-Caption Dataset using Automated Generation Pipeline with Large Audio and Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T10:46:23.545262Z"},"links":{"citing_paper":"/paper/2411.18953"},"observation_digest":"sha256:e108d90dd19cb3eb456a8afba4aee467ebf9a225e97cd56dfa07c1c2ed2ab3da","observation_id":"748f18a3-2bbb-45e2-b8c8-d796dbf03383","resolution":{"observed_at":"2026-08-12T10:46:23.931928Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.00507","last_updated":"2024-06-01T17:28:38Z","snapshot_observed_at":"2026-08-12T23:52:26.924477Z","submitted_at":"2024-06-01T17:28:38Z","title":"Prompt Chaining or Stepwise Prompt? Refinement in Text Summarization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.00507","snapshot_observed_at":"2026-08-12T10:46:23.547684Z","title":"Prompt chaining or stepwise prompt? refinement in text summarization,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18953","last_updated":"2024-11-28T06:50:13Z","snapshot_observed_at":"2026-08-12T10:40:08.789146Z","submitted_at":"2024-11-28T06:50:13Z","title":"AudioSetCaps: An Enriched Audio-Caption Dataset using Automated Generation Pipeline with Large Audio and Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T10:46:23.547684Z"},"links":{"cited_paper":"/paper/2406.00507","citing_paper":"/paper/2411.18953"},"observation_digest":"sha256:90b555d19905874dc682f706b5a8e7b96ec31f7278bb8ea6ebdeb11b330e248c","observation_id":"e668f465-a80e-4cc5-982e-254274855cce","resolution":{"observed_at":"2026-08-12T10:46:23.547684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:46:23.922509Z","title":"Automated audio captioning with recurrent neural networks,","venue":null,"work_id":"f066109c-a06b-4d36-8bb5-0ba46ed14b26","year":2017},"citing_paper":{"arxiv_id":"2411.18953","last_updated":"2024-11-28T06:50:13Z","snapshot_observed_at":"2026-08-12T10:40:08.789146Z","submitted_at":"2024-11-28T06:50:13Z","title":"AudioSetCaps: An Enriched Audio-Caption Dataset using Automated Generation Pipeline with Large Audio and Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T10:46:23.550512Z"},"links":{"citing_paper":"/paper/2411.18953"},"observation_digest":"sha256:df69ffd540532a6554b56e3621cab373fd9a7286143bda95ca04c28449b061cd","observation_id":"6a600e20-b37a-4f8e-aefe-129ce631f31a","resolution":{"observed_at":"2026-08-12T10:46:23.925196Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:46:23.915608Z","title":"Automated audio cap- tioning: An overview of recent progress and new challenges,","venue":null,"work_id":"cf7b89d2-3f60-4ff6-9d71-a01a5a496e82","year":2022},"citing_paper":{"arxiv_id":"2411.18953","last_updated":"2024-11-28T06:50:13Z","snapshot_observed_at":"2026-08-12T10:40:08.789146Z","submitted_at":"2024-11-28T06:50:13Z","title":"AudioSetCaps: An Enriched Audio-Caption Dataset using Automated Generation Pipeline with Large Audio and Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T10:46:23.552716Z"},"links":{"citing_paper":"/paper/2411.18953"},"observation_digest":"sha256:a584b4a24e7c5a84c9e86ffc9058bfc6631181fb74571204c93adc92e3f56f97","observation_id":"e55bcf0f-efbe-4541-b911-c6493ac10e93","resolution":{"observed_at":"2026-08-12T10:46:23.918341Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:46:23.909053Z","title":"Beyond the Status Quo: A contemporary survey of advances and challenges in audio captioning,","venue":null,"work_id":"abfe1cec-ac41-4b02-b65c-954d3892d084","year":2024},"citing_paper":{"arxiv_id":"2411.18953","last_updated":"2024-11-28T06:50:13Z","snapshot_observed_at":"2026-08-12T10:40:08.789146Z","submitted_at":"2024-11-28T06:50:13Z","title":"AudioSetCaps: An Enriched Audio-Caption Dataset using Automated Generation Pipeline with Large Audio and Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T10:46:23.555098Z"},"links":{"citing_paper":"/paper/2411.18953"},"observation_digest":"sha256:21c2b81db85f170220b54be6ac669b3a9f5231b17c4269141d93cdb434e9aa9f","observation_id":"5cdef9eb-96ed-4ca9-b7e7-bacbc9f3636d","resolution":{"observed_at":"2026-08-12T10:46:23.911555Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:46:23.902429Z","title":"HTS-AT: A hierarchical token-semantic audio transformer for sound classification and detection,","venue":null,"work_id":"98e0c629-2e3d-4ecc-aabe-5dbcd2fec189","year":2022},"citing_paper":{"arxiv_id":"2411.18953","last_updated":"2024-11-28T06:50:13Z","snapshot_observed_at":"2026-08-12T10:40:08.789146Z","submitted_at":"2024-11-28T06:50:13Z","title":"AudioSetCaps: An Enriched Audio-Caption Dataset using Automated Generation Pipeline with Large Audio and Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T10:46:23.557535Z"},"links":{"citing_paper":"/paper/2411.18953"},"observation_digest":"sha256:a9732e8d68b5500bade3473879eb0fdfc195758e637fb8b4b8d907957659a49a","observation_id":"b6f33fba-db54-44e9-ae5e-222ca397ce3b","resolution":{"observed_at":"2026-08-12T10:46:23.904939Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:46:23.895559Z","title":"BART: Denoising sequence-to- sequence pre-training for natural language generation, translation, and comprehension,","venue":null,"work_id":"a00bfed8-4be4-4489-b3ff-24a4357204e5","year":2020},"citing_paper":{"arxiv_id":"2411.18953","last_updated":"2024-11-28T06:50:13Z","snapshot_observed_at":"2026-08-12T10:40:08.789146Z","submitted_at":"2024-11-28T06:50:13Z","title":"AudioSetCaps: An Enriched Audio-Caption Dataset using Automated Generation Pipeline with Large Audio and Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T10:46:23.559850Z"},"links":{"citing_paper":"/paper/2411.18953"},"observation_digest":"sha256:5ba50577b5ca06103bb3b63659406227ce61a46b4566887ff2018bda7638ee70","observation_id":"aa36887d-76ef-4160-944d-771faaf6b155","resolution":{"observed_at":"2026-08-12T10:46:23.898276Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:46:23.888835Z","title":"BLEU: a method for automatic evaluation of machine translation,","venue":null,"work_id":"924adeeb-c63c-4bea-88c3-0b8fdda84b52","year":2002},"citing_paper":{"arxiv_id":"2411.18953","last_updated":"2024-11-28T06:50:13Z","snapshot_observed_at":"2026-08-12T10:40:08.789146Z","submitted_at":"2024-11-28T06:50:13Z","title":"AudioSetCaps: An Enriched Audio-Caption Dataset using Automated Generation Pipeline with Large Audio and Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T10:46:23.562395Z"},"links":{"citing_paper":"/paper/2411.18953"},"observation_digest":"sha256:cd07d7b649caf2f1e0c817dd7894b7e711c8b7dff9e8f6510087904cf740eeb7","observation_id":"85acfd53-8061-4388-8457-9f498f86c114","resolution":{"observed_at":"2026-08-12T10:46:23.891478Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:46:23.881493Z","title":"ROUGE: A package for automatic evaluation of summaries,","venue":null,"work_id":"6441963a-3b1e-4950-bc89-a4202c32fc67","year":2004},"citing_paper":{"arxiv_id":"2411.18953","last_updated":"2024-11-28T06:50:13Z","snapshot_observed_at":"2026-08-12T10:40:08.789146Z","submitted_at":"2024-11-28T06:50:13Z","title":"AudioSetCaps: An Enriched Audio-Caption Dataset using Automated Generation Pipeline with Large Audio and Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T10:46:23.564750Z"},"links":{"citing_paper":"/paper/2411.18953"},"observation_digest":"sha256:2f4a0c762a01f2aa309d4e35a4b58abaa198165ed4ca323889bd410b63d39533","observation_id":"3e43268d-f253-4f4b-8beb-59223e87714c","resolution":{"observed_at":"2026-08-12T10:46:23.884067Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:46:23.874649Z","title":"METEOR: An automatic metric for mt evalu- ation with improved correlation with human judgments,","venue":null,"work_id":"0e55ac18-87e8-4b2d-a058-187a33c4650f","year":2005},"citing_paper":{"arxiv_id":"2411.18953","last_updated":"2024-11-28T06:50:13Z","snapshot_observed_at":"2026-08-12T10:40:08.789146Z","submitted_at":"2024-11-28T06:50:13Z","title":"AudioSetCaps: An Enriched Audio-Caption Dataset using Automated Generation Pipeline with Large Audio and Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T10:46:23.567063Z"},"links":{"citing_paper":"/paper/2411.18953"},"observation_digest":"sha256:5eff789377e872ec7ca7ea45bbfe19069b8fb5f9c3cc90692f100392b0b4bc4a","observation_id":"ae0e2482-55a8-46d8-9cf0-f0a94091ee2b","resolution":{"observed_at":"2026-08-12T10:46:23.877431Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:46:23.866768Z","title":"CIDEr: Consensus- based image description evaluation,","venue":null,"work_id":"defb3376-51ca-4919-b4e4-5c9b148f9991","year":2015},"citing_paper":{"arxiv_id":"2411.18953","last_updated":"2024-11-28T06:50:13Z","snapshot_observed_at":"2026-08-12T10:40:08.789146Z","submitted_at":"2024-11-28T06:50:13Z","title":"AudioSetCaps: An Enriched Audio-Caption Dataset using Automated Generation Pipeline with Large Audio and Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T10:46:23.569233Z"},"links":{"citing_paper":"/paper/2411.18953"},"observation_digest":"sha256:f6a50d00a26021013401987d10ec1ea1d37f3cf41e27165e183d1628684e9e26","observation_id":"99f8ee5e-7073-4463-a19d-8dd8ec3bdf39","resolution":{"observed_at":"2026-08-12T10:46:23.869698Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:46:23.859374Z","title":"SPICE: Semantic propositional image caption evaluation,","venue":null,"work_id":"ead4d945-55aa-4f6f-8bca-ed909cddb57a","year":2016},"citing_paper":{"arxiv_id":"2411.18953","last_updated":"2024-11-28T06:50:13Z","snapshot_observed_at":"2026-08-12T10:40:08.789146Z","submitted_at":"2024-11-28T06:50:13Z","title":"AudioSetCaps: An Enriched Audio-Caption Dataset using Automated Generation Pipeline with Large Audio and Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T10:46:23.571594Z"},"links":{"citing_paper":"/paper/2411.18953"},"observation_digest":"sha256:42df88cbb46ca75511a217d8312714d7c41a5261276e4e05dfdc40f7820cee32","observation_id":"7effa66e-3450-4e30-a92b-6431f4de1500","resolution":{"observed_at":"2026-08-12T10:46:23.862108Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:46:23.852161Z","title":"Improved image captioning via policy gradient optimization of SPIDEr,","venue":null,"work_id":"501e1de0-d88d-4e90-9322-b898dbf7d0a9","year":2017},"citing_paper":{"arxiv_id":"2411.18953","last_updated":"2024-11-28T06:50:13Z","snapshot_observed_at":"2026-08-12T10:40:08.789146Z","submitted_at":"2024-11-28T06:50:13Z","title":"AudioSetCaps: An Enriched Audio-Caption Dataset using Automated Generation Pipeline with Large Audio and Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T10:46:23.573955Z"},"links":{"citing_paper":"/paper/2411.18953"},"observation_digest":"sha256:962d96e597eed40359849530df486efb7b81fb7e8e811d36e50ff6d0a8945fd1","observation_id":"0defaa85-deb6-4f3b-94db-e971433ea7c4","resolution":{"observed_at":"2026-08-12T10:46:23.854949Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:46:23.844560Z","title":"EnCLAP: Combining neural audio codec and audio-text joint embedding for automated audio cap- tioning,","venue":null,"work_id":"12b1f327-45ed-4692-862e-02173ba99181","year":2024},"citing_paper":{"arxiv_id":"2411.18953","last_updated":"2024-11-28T06:50:13Z","snapshot_observed_at":"2026-08-12T10:40:08.789146Z","submitted_at":"2024-11-28T06:50:13Z","title":"AudioSetCaps: An Enriched Audio-Caption Dataset using Automated Generation Pipeline with Large Audio and Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T10:46:23.576341Z"},"links":{"citing_paper":"/paper/2411.18953"},"observation_digest":"sha256:84a2b03d7f2a26c030e286de244704fa4528d819d0259d5273d2870bf35c0d2a","observation_id":"b17b16cf-a201-4da7-9d4a-8e4c5e4a9e3b","resolution":{"observed_at":"2026-08-12T10:46:23.847422Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:46:23.837237Z","title":"CoNeTTE: An efficient audio captioning system leveraging multiple datasets with task embedding,","venue":null,"work_id":"3afd33f8-f5d7-42ce-a34e-1f6b36f96c33","year":2024},"citing_paper":{"arxiv_id":"2411.18953","last_updated":"2024-11-28T06:50:13Z","snapshot_observed_at":"2026-08-12T10:40:08.789146Z","submitted_at":"2024-11-28T06:50:13Z","title":"AudioSetCaps: An Enriched Audio-Caption Dataset using Automated Generation Pipeline with Large Audio and Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T10:46:23.578773Z"},"links":{"citing_paper":"/paper/2411.18953"},"observation_digest":"sha256:93f669ee107a283b95a35768e5e0ef2833f1804c61e299fd4fc5621bd46bb187","observation_id":"ea6a31d0-8fb8-451d-babe-cc4b4977a19c","resolution":{"observed_at":"2026-08-12T10:46:23.840158Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19388","last_updated":"2025-04-16T17:40:22Z","snapshot_observed_at":"2026-08-12T23:33:23.936429Z","submitted_at":"2024-06-27T17:58:54Z","title":"Taming Data and Transformers for Audio Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19388","snapshot_observed_at":"2026-08-12T10:46:23.581165Z","title":"Taming data and transformers for audio generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18953","last_updated":"2024-11-28T06:50:13Z","snapshot_observed_at":"2026-08-12T10:40:08.789146Z","submitted_at":"2024-11-28T06:50:13Z","title":"AudioSetCaps: An Enriched Audio-Caption Dataset using Automated Generation Pipeline with Large Audio and Language Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T10:46:23.581165Z"},"links":{"cited_paper":"/paper/2406.19388","citing_paper":"/paper/2411.18953"},"observation_digest":"sha256:74a77b2064fd2de79a376ed0b67a6cee77dcaf45cecbc5e7bdf9c34bfee8e65b","observation_id":"ca402966-e9f1-484e-8561-a58021840176","resolution":{"observed_at":"2026-08-12T10:46:23.581165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07012","last_updated":"2024-06-17T02:24:22Z","snapshot_observed_at":"2026-08-12T23:45:49.452490Z","submitted_at":"2024-06-11T07:12:12Z","title":"Bridging Language Gaps in Audio-Text Retrieval","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07012","snapshot_observed_at":"2026-08-12T10:46:23.583660Z","title":"Bridging language gaps in audio-text retrieval,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18953","last_updated":"2024-11-28T06:50:13Z","snapshot_observed_at":"2026-08-12T10:40:08.789146Z","submitted_at":"2024-11-28T06:50:13Z","title":"AudioSetCaps: An Enriched Audio-Caption Dataset using Automated Generation Pipeline with Large Audio and Language Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T10:46:23.583660Z"},"links":{"cited_paper":"/paper/2406.07012","citing_paper":"/paper/2411.18953"},"observation_digest":"sha256:bbfd0edf67e783573b7476bd4626fe9b6770fa88ee34323ba3b0f77efbdfc3b1","observation_id":"7b14bb3e-303a-4526-85d9-a59f16d7b0c3","resolution":{"observed_at":"2026-08-12T10:46:23.583660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:46:23.830303Z","title":"Language-based Audio Retrieval Task in DCASE 2022 Challenge,","venue":null,"work_id":"730d7b41-2fff-4acc-99af-1f8a17f2ac09","year":2022},"citing_paper":{"arxiv_id":"2411.18953","last_updated":"2024-11-28T06:50:13Z","snapshot_observed_at":"2026-08-12T10:40:08.789146Z","submitted_at":"2024-11-28T06:50:13Z","title":"AudioSetCaps: An Enriched Audio-Caption Dataset using Automated Generation Pipeline with Large Audio and Language Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T10:46:23.586339Z"},"links":{"citing_paper":"/paper/2411.18953"},"observation_digest":"sha256:359ec6654769d6b5a406959e982986a7b987fdb29be208cb1f154638a3845dd5","observation_id":"47cbc6da-e85c-41e2-8fe3-0814f149b2bf","resolution":{"observed_at":"2026-08-12T10:46:23.832888Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:46:23.823112Z","title":"On metric learning for audio-text cross-modal retrieval,","venue":null,"work_id":"c808a6de-70fe-4773-8b61-9ca3771a2b6d","year":2022},"citing_paper":{"arxiv_id":"2411.18953","last_updated":"2024-11-28T06:50:13Z","snapshot_observed_at":"2026-08-12T10:40:08.789146Z","submitted_at":"2024-11-28T06:50:13Z","title":"AudioSetCaps: An Enriched Audio-Caption Dataset using Automated Generation Pipeline with Large Audio and Language Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T10:46:23.588770Z"},"links":{"citing_paper":"/paper/2411.18953"},"observation_digest":"sha256:de85dba0684e8109e507e4ace83c7a9aa5df5596b8e9de8c4f4af7362e341289","observation_id":"716f0ad4-8b3a-4022-81cd-22d38ca135eb","resolution":{"observed_at":"2026-08-12T10:46:23.825638Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:46:23.815715Z","title":"Audio-text retrieval in context,","venue":null,"work_id":"68942e36-3051-454b-8142-6fdcefa5f430","year":2022},"citing_paper":{"arxiv_id":"2411.18953","last_updated":"2024-11-28T06:50:13Z","snapshot_observed_at":"2026-08-12T10:40:08.789146Z","submitted_at":"2024-11-28T06:50:13Z","title":"AudioSetCaps: An Enriched Audio-Caption Dataset using Automated Generation Pipeline with Large Audio and Language Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T10:46:23.591035Z"},"links":{"citing_paper":"/paper/2411.18953"},"observation_digest":"sha256:196cf38a27fb25d4d6f85ff129accd6e158096637a602d77c02f9ef88810be11","observation_id":"c239b82e-ec42-407c-a247-6a915d972e0a","resolution":{"observed_at":"2026-08-12T10:46:23.818473Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:46:23.593657Z","title":"Momentum contrast for unsupervised visual representation learning,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.18953","last_updated":"2024-11-28T06:50:13Z","snapshot_observed_at":"2026-08-12T10:40:08.789146Z","submitted_at":"2024-11-28T06:50:13Z","title":"AudioSetCaps: An Enriched Audio-Caption Dataset using Automated Generation Pipeline with Large Audio and Language Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T10:46:23.593657Z"},"links":{"citing_paper":"/paper/2411.18953"},"observation_digest":"sha256:84ba99a3c43bcfbb27893f4b18e8c052524cd4ec99aa31e6056e81439bbe68c4","observation_id":"b09eaca3-bdf7-4705-bced-ae5a5300e589","resolution":{"observed_at":"2026-08-12T10:46:23.593657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:46:23.595993Z","title":"BERT: Pre- training of deep bidirectional transformers for language understanding,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.18953","last_updated":"2024-11-28T06:50:13Z","snapshot_observed_at":"2026-08-12T10:40:08.789146Z","submitted_at":"2024-11-28T06:50:13Z","title":"AudioSetCaps: An Enriched Audio-Caption Dataset using Automated Generation Pipeline with Large Audio and Language Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T10:46:23.595993Z"},"links":{"citing_paper":"/paper/2411.18953"},"observation_digest":"sha256:2448f1d49d6d5bb86eb6be8fdd7a8a7652af28ab85e8af52bc53c30020929149","observation_id":"cee41d20-b763-4d4b-b797-5cdf188e1bfe","resolution":{"observed_at":"2026-08-12T10:46:23.595993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.11692","last_updated":"2019-07-26T17:48:29Z","snapshot_observed_at":"2026-07-31T22:31:37.910868Z","submitted_at":"2019-07-26T17:48:29Z","title":"RoBERTa: A Robustly Optimized BERT Pretraining Approach","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.11692","snapshot_observed_at":"2026-08-12T10:46:23.598481Z","title":"RoBERTa: A robustly optimized bert pretraining approach,","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2411.18953","last_updated":"2024-11-28T06:50:13Z","snapshot_observed_at":"2026-08-12T10:40:08.789146Z","submitted_at":"2024-11-28T06:50:13Z","title":"AudioSetCaps: An Enriched Audio-Caption Dataset using Automated Generation Pipeline with Large Audio and Language Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T10:46:23.598481Z"},"links":{"cited_paper":"/paper/1907.11692","citing_paper":"/paper/2411.18953"},"observation_digest":"sha256:3f93cc23da7bdf23d01bdd6e6d7e89f9cc480e439b8e04396d6543467ad1e2fe","observation_id":"1dc61dd2-70c1-4e9a-b933-87385846af75","resolution":{"observed_at":"2026-08-12T10:46:23.598481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:46:23.800590Z","title":"CED: Consistent ensemble distillation for audio tagging,","venue":null,"work_id":"0a95939a-9631-4560-8bd8-bd6473dd9434","year":2024},"citing_paper":{"arxiv_id":"2411.18953","last_updated":"2024-11-28T06:50:13Z","snapshot_observed_at":"2026-08-12T10:40:08.789146Z","submitted_at":"2024-11-28T06:50:13Z","title":"AudioSetCaps: An Enriched Audio-Caption Dataset using Automated Generation Pipeline with Large Audio and Language Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T10:46:23.601051Z"},"links":{"citing_paper":"/paper/2411.18953"},"observation_digest":"sha256:8500e9f9f9246dc1b97288f64c20c1617a256fee7ca722716e4a4a3822ff7ffa","observation_id":"c987fde5-e302-4034-b548-a4eb27d8b031","resolution":{"observed_at":"2026-08-12T10:46:23.803377Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.11466","last_updated":"2023-08-23T10:46:16Z","snapshot_observed_at":"2026-08-05T20:14:04.020947Z","submitted_at":"2023-08-22T14:25:15Z","title":"SONAR: Sentence-Level Multimodal and Language-Agnostic Representations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.11466","snapshot_observed_at":"2026-08-12T10:46:23.603547Z","title":"SONAR: Sentence- level multimodal and language-agnostic representations,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18953","last_updated":"2024-11-28T06:50:13Z","snapshot_observed_at":"2026-08-12T10:40:08.789146Z","submitted_at":"2024-11-28T06:50:13Z","title":"AudioSetCaps: An Enriched Audio-Caption Dataset using Automated Generation Pipeline with Large Audio and Language Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T10:46:23.603547Z"},"links":{"cited_paper":"/paper/2308.11466","citing_paper":"/paper/2411.18953"},"observation_digest":"sha256:613e9564ef810b743a4be692ab1cdbff64e932e908eda62a0b7528d1bb2ee184","observation_id":"8ed14750-33cc-4f36-a9a6-d3f5d8ebf5de","resolution":{"observed_at":"2026-08-12T10:46:23.603547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:46:23.792795Z","title":"Zero-shot audio classification based on class label embeddings,","venue":null,"work_id":"cb9faedd-46de-464d-ba08-51efa91797cc","year":2019},"citing_paper":{"arxiv_id":"2411.18953","last_updated":"2024-11-28T06:50:13Z","snapshot_observed_at":"2026-08-12T10:40:08.789146Z","submitted_at":"2024-11-28T06:50:13Z","title":"AudioSetCaps: An Enriched Audio-Caption Dataset using Automated Generation Pipeline with Large Audio and Language Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T10:46:23.606297Z"},"links":{"citing_paper":"/paper/2411.18953"},"observation_digest":"sha256:5af5f172a9240cfab6ac202d084d0c0ac97e006377a1622ee505f8114ca01fcb","observation_id":"ee550096-6068-4f51-96ee-bfd8a58a5077","resolution":{"observed_at":"2026-08-12T10:46:23.795741Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:46:23.785519Z","title":"Zero-shot audio classification via semantic embeddings,","venue":null,"work_id":"cb80c938-9771-4234-b389-e8ac7d41b4e4","year":2021},"citing_paper":{"arxiv_id":"2411.18953","last_updated":"2024-11-28T06:50:13Z","snapshot_observed_at":"2026-08-12T10:40:08.789146Z","submitted_at":"2024-11-28T06:50:13Z","title":"AudioSetCaps: An Enriched Audio-Caption Dataset using Automated Generation Pipeline with Large Audio and Language Models","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-12T10:46:23.608703Z"},"links":{"citing_paper":"/paper/2411.18953"},"observation_digest":"sha256:8cf3058edd3b3d7c54c7aae833e74a625ec2b7a8cd38801de756151d0f80ba4a","observation_id":"ec1a6be6-1f34-41c2-9881-b14f3e405b75","resolution":{"observed_at":"2026-08-12T10:46:23.788393Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:46:23.778401Z","title":"A dataset and taxonomy for urban sound research,","venue":null,"work_id":"c26a71c7-351d-4597-b06e-e3da5502f2d8","year":2014},"citing_paper":{"arxiv_id":"2411.18953","last_updated":"2024-11-28T06:50:13Z","snapshot_observed_at":"2026-08-12T10:40:08.789146Z","submitted_at":"2024-11-28T06:50:13Z","title":"AudioSetCaps: An Enriched Audio-Caption Dataset using Automated Generation Pipeline with Large Audio and Language Models","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-12T10:46:23.610973Z"},"links":{"citing_paper":"/paper/2411.18953"},"observation_digest":"sha256:9173cb59404d462a0cde82b2039589ccb649c4ed417a7dd2625262d05893ee63","observation_id":"c63467ed-dff0-4033-91c6-9eb6d43fd350","resolution":{"observed_at":"2026-08-12T10:46:23.781137Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:46:23.771127Z","title":"ESC: Dataset for environmental sound classification,","venue":null,"work_id":"b3266269-ff70-4466-84ad-4fd2afb88d46","year":2015},"citing_paper":{"arxiv_id":"2411.18953","last_updated":"2024-11-28T06:50:13Z","snapshot_observed_at":"2026-08-12T10:40:08.789146Z","submitted_at":"2024-11-28T06:50:13Z","title":"AudioSetCaps: An Enriched Audio-Caption Dataset using Automated Generation Pipeline with Large Audio and Language Models","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-12T10:46:23.613339Z"},"links":{"citing_paper":"/paper/2411.18953"},"observation_digest":"sha256:7d4885e74bc9d4d255a2cc40814118af5b62d8199d6a9da0607a06bb57d20c7b","observation_id":"1a70be6d-78e9-42d0-829f-28064a60410f","resolution":{"observed_at":"2026-08-12T10:46:23.773913Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:46:23.764013Z","title":"Common V oice: A massively-multilingual speech corpus,","venue":null,"work_id":"241334f7-7b73-44c7-96f0-724b100c02b5","year":2020},"citing_paper":{"arxiv_id":"2411.18953","last_updated":"2024-11-28T06:50:13Z","snapshot_observed_at":"2026-08-12T10:40:08.789146Z","submitted_at":"2024-11-28T06:50:13Z","title":"AudioSetCaps: An Enriched Audio-Caption Dataset using Automated Generation Pipeline with Large Audio and Language Models","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-12T10:46:23.615535Z"},"links":{"citing_paper":"/paper/2411.18953"},"observation_digest":"sha256:1da64fb85bdce23dc2ac3b24f777e973e1704e30485250b63e3bdbaac0e547d4","observation_id":"2fac8381-5f92-4251-bfee-977d69e70d3d","resolution":{"observed_at":"2026-08-12T10:46:23.766729Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:46:23.617990Z","title":"CREMA-D: Crowd-sourced emotional multimodal actors dataset,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2411.18953","last_updated":"2024-11-28T06:50:13Z","snapshot_observed_at":"2026-08-12T10:40:08.789146Z","submitted_at":"2024-11-28T06:50:13Z","title":"AudioSetCaps: An Enriched Audio-Caption Dataset using Automated Generation Pipeline with Large Audio and Language Models","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-12T10:46:23.617990Z"},"links":{"citing_paper":"/paper/2411.18953"},"observation_digest":"sha256:66f2ea2d061f5fca96a31cd00ef80e64ac12b04b19e9ec59284a8a060099b477","observation_id":"d4f10cf4-21ac-40f6-b90d-aa60b18d2462","resolution":{"observed_at":"2026-08-12T10:46:23.617990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:46:23.753112Z","title":"The ryerson audio-visual database of emotional speech and song (RA VDESS): A dynamic, multimodal set of facial and vocal expressions in north american english,","venue":null,"work_id":"6b46e89a-6afb-4cc5-a14d-58bddec08fc3","year":2018},"citing_paper":{"arxiv_id":"2411.18953","last_updated":"2024-11-28T06:50:13Z","snapshot_observed_at":"2026-08-12T10:40:08.789146Z","submitted_at":"2024-11-28T06:50:13Z","title":"AudioSetCaps: An Enriched Audio-Caption Dataset using Automated Generation Pipeline with Large Audio and Language Models","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-12T10:46:23.620375Z"},"links":{"citing_paper":"/paper/2411.18953"},"observation_digest":"sha256:e2655c77ce0e9364cbff16ab4b751d131d3e843c36cea464d7024b13545eabad","observation_id":"2eff404b-cbdf-4265-84e2-48aa01e9330f","resolution":{"observed_at":"2026-08-12T10:46:23.755928Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:46:23.745767Z","title":"Automatic musical genre clas- sification of audio signals,","venue":null,"work_id":"85904e7a-fe23-4364-be8a-f646b5d0f5d9","year":2001},"citing_paper":{"arxiv_id":"2411.18953","last_updated":"2024-11-28T06:50:13Z","snapshot_observed_at":"2026-08-12T10:40:08.789146Z","submitted_at":"2024-11-28T06:50:13Z","title":"AudioSetCaps: An Enriched Audio-Caption Dataset using Automated Generation Pipeline with Large Audio and Language Models","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-12T10:46:23.622753Z"},"links":{"citing_paper":"/paper/2411.18953"},"observation_digest":"sha256:dd96a99f615ff6570a1e3f3e50d38367ab4dc263ffd2f28e5f1351e4014a01a1","observation_id":"c6807c65-e7c8-47e2-9b09-65f31a822756","resolution":{"observed_at":"2026-08-12T10:46:23.748565Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:46:23.738166Z","title":"OpenMIC-2018: An open data-set for multiple instrument recognition,","venue":null,"work_id":"300c453b-6fae-441b-bffe-39144f907c34","year":2018},"citing_paper":{"arxiv_id":"2411.18953","last_updated":"2024-11-28T06:50:13Z","snapshot_observed_at":"2026-08-12T10:40:08.789146Z","submitted_at":"2024-11-28T06:50:13Z","title":"AudioSetCaps: An Enriched Audio-Caption Dataset using Automated Generation Pipeline with Large Audio and Language Models","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-12T10:46:23.625101Z"},"links":{"citing_paper":"/paper/2411.18953"},"observation_digest":"sha256:d244732d01758d8faa3dc10835561a75a91d58c8bc63874f3b7cc2c0d317d6a5","observation_id":"b8237517-42ab-46ae-8f75-d837defccb9f","resolution":{"observed_at":"2026-08-12T10:46:23.740943Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.18953","last_updated":"2024-11-28T06:50:13Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-12T10:40:08.789146Z","submitted_at":"2024-11-28T06:50:13Z","title":"AudioSetCaps: An Enriched Audio-Caption Dataset using Automated Generation Pipeline with Large Audio and Language Models"},"reference_resolution":{"displayed":62,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":19,"verified_exact":1,"verified_fuzzy":42},"total_outbound_references":62},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 62 of 62 outbound references and 4 inbound Pith citation observations for arXiv:2411.18953."}