{"as_of":"2026-08-10T06:49:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:451590c4c7740d1651f9670ad8f780d6c6b45efe29a24542017a3a71456d33cf","coverage":[{"denominator":36,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":36,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:29:41.089739Z","state":"measured"},{"denominator":37,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":37,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:29:37.637530Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T15:29:41.315494Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.14989","last_updated":"2025-05-21T00:27:38Z","snapshot_observed_at":"2026-08-07T15:23:40.228446Z","submitted_at":"2025-05-21T00:27:38Z","title":"Discrete Audio Representations for Automated Audio Captioning","version":1},"cited_work":{"arxiv_id":"2505.14989","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.14989","snapshot_observed_at":"2026-08-07T15:29:41.315494Z","title":"Discrete Audio Representations for Automated Audio Captioning","venue":"cs.SD","work_id":"784d7fad-d6ec-474b-b138-1e12e23aed7b","year":2025},"citing_paper":{"arxiv_id":"2505.14989","last_updated":"2025-05-21T00:27:38Z","snapshot_observed_at":"2026-08-07T15:23:40.228446Z","submitted_at":"2025-05-21T00:27:38Z","title":"Discrete Audio Representations for Automated Audio Captioning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T15:29:37.637530Z"},"links":{"cited_paper":"/paper/2505.14989","citing_paper":"/paper/2505.14989"},"observation_digest":"sha256:dd105c02c4b2696f6a76705908a125fc225fa05fb40424afbd136b5d44d95731","observation_id":"99f40907-dc3f-4326-98e4-a199b836bdaa","resolution":{"observed_at":"2026-08-07T15:29:41.407940Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.14989/citation-record","integrity":"/paper/2505.14989/integrity","json":"/paper/2505.14989/citation-record.json","paper":"/paper/2505.14989"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.14989","last_updated":"2025-05-21T00:27:38Z","snapshot_observed_at":"2026-08-07T15:23:40.228446Z","submitted_at":"2025-05-21T00:27:38Z","title":"Discrete Audio Representations for Automated Audio Captioning","version":1},"cited_work":{"arxiv_id":"2505.14989","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.14989","snapshot_observed_at":"2026-08-07T15:29:41.315494Z","title":"Discrete Audio Representations for Automated Audio Captioning","venue":"cs.SD","work_id":"784d7fad-d6ec-474b-b138-1e12e23aed7b","year":2025},"citing_paper":{"arxiv_id":"2505.14989","last_updated":"2025-05-21T00:27:38Z","snapshot_observed_at":"2026-08-07T15:23:40.228446Z","submitted_at":"2025-05-21T00:27:38Z","title":"Discrete Audio Representations for Automated Audio Captioning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T15:29:37.637530Z"},"links":{"cited_paper":"/paper/2505.14989","citing_paper":"/paper/2505.14989"},"observation_digest":"sha256:dd105c02c4b2696f6a76705908a125fc225fa05fb40424afbd136b5d44d95731","observation_id":"99f40907-dc3f-4326-98e4-a199b836bdaa","resolution":{"observed_at":"2026-08-07T15:29:41.407940Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:29:43.962012Z","title":"We construct BART-based and GPT-2 XL-based AAC systems, both utilizing semantic and acoustic tokens","venue":null,"work_id":"53bf1f90-2397-4350-99fc-0ad776d3bb6e","year":null},"citing_paper":{"arxiv_id":"2505.14989","last_updated":"2025-05-21T00:27:38Z","snapshot_observed_at":"2026-08-07T15:23:40.228446Z","submitted_at":"2025-05-21T00:27:38Z","title":"Discrete Audio Representations for Automated Audio Captioning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T15:29:37.685143Z"},"links":{"citing_paper":"/paper/2505.14989"},"observation_digest":"sha256:bf593450321f2a3989fc7bab7c15802c3ab7db456315cea1c7830ccb39e532db","observation_id":"33ad1828-4fd5-4d8e-bb50-0923888c62ad","resolution":{"observed_at":"2026-08-07T15:29:44.012926Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:29:43.814305Z","title":null,"venue":null,"work_id":"e71f0f02-4a23-4c8f-9456-379d2bbf5502","year":null},"citing_paper":{"arxiv_id":"2505.14989","last_updated":"2025-05-21T00:27:38Z","snapshot_observed_at":"2026-08-07T15:23:40.228446Z","submitted_at":"2025-05-21T00:27:38Z","title":"Discrete Audio Representations for Automated Audio Captioning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T15:29:37.771872Z"},"links":{"citing_paper":"/paper/2505.14989"},"observation_digest":"sha256:ca067bc065699a155a2477ffccf07f7a88e58a4deb47013fe620eeb0af49fc0a","observation_id":"cefd1b20-81c4-4ea7-a9c9-c6e2de374566","resolution":{"observed_at":"2026-08-07T15:29:43.877697Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:29:43.677664Z","title":"Our findings indicate that semantic tokens significantly outperform acoustic tokens in this context","venue":null,"work_id":"5620e7de-6a79-4e05-8cfa-7ae9f9655ee0","year":null},"citing_paper":{"arxiv_id":"2505.14989","last_updated":"2025-05-21T00:27:38Z","snapshot_observed_at":"2026-08-07T15:23:40.228446Z","submitted_at":"2025-05-21T00:27:38Z","title":"Discrete Audio Representations for Automated Audio Captioning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T15:29:37.837897Z"},"links":{"citing_paper":"/paper/2505.14989"},"observation_digest":"sha256:cfb59d6e3ecf9ecf0da69dd1096317564723b4bb9907f2f6a6ac60757f650c19","observation_id":"72d3ae5e-6dc2-4d14-8e49-086a70a44d25","resolution":{"observed_at":"2026-08-07T15:29:43.729200Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:29:43.549115Z","title":"Automated audio captioning: An overview of recent progress and new challenges,","venue":null,"work_id":"a6b35b31-0e47-48aa-b96b-09a140402a97","year":2022},"citing_paper":{"arxiv_id":"2505.14989","last_updated":"2025-05-21T00:27:38Z","snapshot_observed_at":"2026-08-07T15:23:40.228446Z","submitted_at":"2025-05-21T00:27:38Z","title":"Discrete Audio Representations for Automated Audio Captioning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T15:29:37.933826Z"},"links":{"citing_paper":"/paper/2505.14989"},"observation_digest":"sha256:f14bdf3c74fdbf4bac413059b3eb3534f88a02701cd0159b650d2c362a86f539","observation_id":"603fc8e4-6430-4c5f-b5f4-a5dffa6819bf","resolution":{"observed_at":"2026-08-07T15:29:43.606953Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:29:43.388001Z","title":"Audio captioning based on transformer and pre-trained cnn,","venue":null,"work_id":"66707fef-0a14-492c-a0fa-964108c55b4b","year":2020},"citing_paper":{"arxiv_id":"2505.14989","last_updated":"2025-05-21T00:27:38Z","snapshot_observed_at":"2026-08-07T15:23:40.228446Z","submitted_at":"2025-05-21T00:27:38Z","title":"Discrete Audio Representations for Automated Audio Captioning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T15:29:38.002613Z"},"links":{"citing_paper":"/paper/2505.14989"},"observation_digest":"sha256:e9352a601e2bd0c9773ce5b898333445a9cb4ea5b8790a2ec8b914e6f8adb2c2","observation_id":"c8825f6b-0b1c-4c98-b2d7-44a980073a55","resolution":{"observed_at":"2026-08-07T15:29:43.460031Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:29:43.259787Z","title":"Automated audio caption- ing by fine-tuning bart with audioset tags,","venue":null,"work_id":"25c4a80c-0f22-4b90-964a-fcf18e1f1d75","year":2021},"citing_paper":{"arxiv_id":"2505.14989","last_updated":"2025-05-21T00:27:38Z","snapshot_observed_at":"2026-08-07T15:23:40.228446Z","submitted_at":"2025-05-21T00:27:38Z","title":"Discrete Audio Representations for Automated Audio Captioning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T15:29:38.078918Z"},"links":{"citing_paper":"/paper/2505.14989"},"observation_digest":"sha256:814e44301275d97e624275d6f2b7c827a5ebe6b836767aae46840b2e32cf183c","observation_id":"59b5a379-4928-4a17-ad1d-929c748ca906","resolution":{"observed_at":"2026-08-07T15:29:43.305054Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:29:43.102623Z","title":"Leveraging pre-trained bert for audio captioning,","venue":null,"work_id":"bec0367c-2d80-49ae-bdc8-8462a2b779fa","year":2022},"citing_paper":{"arxiv_id":"2505.14989","last_updated":"2025-05-21T00:27:38Z","snapshot_observed_at":"2026-08-07T15:23:40.228446Z","submitted_at":"2025-05-21T00:27:38Z","title":"Discrete Audio Representations for Automated Audio Captioning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T15:29:38.173354Z"},"links":{"citing_paper":"/paper/2505.14989"},"observation_digest":"sha256:c586e7ebf2dc96877f6d2eca705690946aa0e125a9e4b10772f279d59df6afc4","observation_id":"f8b710d6-2282-4147-9d68-64b5259cbd75","resolution":{"observed_at":"2026-08-07T15:29:43.170929Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:29:42.963724Z","title":"Conette: An efficient au- dio captioning system leveraging multiple datasets with task em- bedding,","venue":null,"work_id":"10821f7a-51fb-4cb7-986f-fc502b5537e2","year":2024},"citing_paper":{"arxiv_id":"2505.14989","last_updated":"2025-05-21T00:27:38Z","snapshot_observed_at":"2026-08-07T15:23:40.228446Z","submitted_at":"2025-05-21T00:27:38Z","title":"Discrete Audio Representations for Automated Audio Captioning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T15:29:38.274473Z"},"links":{"citing_paper":"/paper/2505.14989"},"observation_digest":"sha256:30163c1b23c1567d18772d079ff3a802194b44c2b5c6cdc39cc7f3a1d9de39e9","observation_id":"83fc5ec3-ab4e-4553-bf30-3d2aac66599b","resolution":{"observed_at":"2026-08-07T15:29:43.032026Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:29:42.829172Z","title":"Improving audio captioning mod- els with fine-grained audio features, text embedding supervision, and llm mix-up augmentation,","venue":null,"work_id":"b9a76502-4289-4be7-93ec-6e8b92cca1d0","year":2024},"citing_paper":{"arxiv_id":"2505.14989","last_updated":"2025-05-21T00:27:38Z","snapshot_observed_at":"2026-08-07T15:23:40.228446Z","submitted_at":"2025-05-21T00:27:38Z","title":"Discrete Audio Representations for Automated Audio Captioning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T15:29:38.375285Z"},"links":{"citing_paper":"/paper/2505.14989"},"observation_digest":"sha256:bf04c939b30f779806e44b421325c2132b5d75322ccacd142ce6ad460a33c465","observation_id":"e6243da2-8ba2-4ee1-ac41-5b5c5bb07e3f","resolution":{"observed_at":"2026-08-07T15:29:42.889413Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:29:38.478425Z","title":"Panns: Large-scale pretrained audio neural networks for audio pattern recognition,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.14989","last_updated":"2025-05-21T00:27:38Z","snapshot_observed_at":"2026-08-07T15:23:40.228446Z","submitted_at":"2025-05-21T00:27:38Z","title":"Discrete Audio Representations for Automated Audio Captioning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T15:29:38.478425Z"},"links":{"citing_paper":"/paper/2505.14989"},"observation_digest":"sha256:9953a74e490db4a037699629815bb81cd85061461ca60fdfad9e1239fdd98b5e","observation_id":"35d13838-760a-4507-a964-a3d39b0c42e4","resolution":{"observed_at":"2026-08-07T15:29:38.478425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:29:42.666667Z","title":"Adapting a convnext model to audio classification on au- dioset,","venue":null,"work_id":"3be3f9ed-9c9c-48e6-8472-0c98b9376f87","year":2023},"citing_paper":{"arxiv_id":"2505.14989","last_updated":"2025-05-21T00:27:38Z","snapshot_observed_at":"2026-08-07T15:23:40.228446Z","submitted_at":"2025-05-21T00:27:38Z","title":"Discrete Audio Representations for Automated Audio Captioning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T15:29:38.560986Z"},"links":{"citing_paper":"/paper/2505.14989"},"observation_digest":"sha256:bc3bbc3ba1481a23a1de2f3e4ab2e368670bca1b4ecb147b144fe95d0dd9797a","observation_id":"bb3ef9d7-fdaa-49fb-a8eb-c94b7d2dcecf","resolution":{"observed_at":"2026-08-07T15:29:42.746482Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:29:42.494919Z","title":"Beats: audio pre-training with acoustic tok- enizers,","venue":null,"work_id":"493dea96-79cb-4f8b-9dc2-a6184549c089","year":2023},"citing_paper":{"arxiv_id":"2505.14989","last_updated":"2025-05-21T00:27:38Z","snapshot_observed_at":"2026-08-07T15:23:40.228446Z","submitted_at":"2025-05-21T00:27:38Z","title":"Discrete Audio Representations for Automated Audio Captioning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T15:29:38.654264Z"},"links":{"citing_paper":"/paper/2505.14989"},"observation_digest":"sha256:48a2e9f55a9d9cb25c6c8525964b16a16ef8efd47b844c020ae6f1b7f6aa648f","observation_id":"46b92cf6-81f9-48cc-933a-4c058438af93","resolution":{"observed_at":"2026-08-07T15:29:42.551062Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-07-30T09:12:38.100527Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-07T15:29:38.730373Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.14989","last_updated":"2025-05-21T00:27:38Z","snapshot_observed_at":"2026-08-07T15:23:40.228446Z","submitted_at":"2025-05-21T00:27:38Z","title":"Discrete Audio Representations for Automated Audio Captioning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T15:29:38.730373Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2505.14989"},"observation_digest":"sha256:6a432f9031eb3836b21a802c79694d2f4accefe549cfd312289f158e3c8f71a4","observation_id":"6b9661e5-d984-425b-8ea9-a1c8e8aff9c9","resolution":{"observed_at":"2026-08-07T15:29:38.730373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.13461","last_updated":"2019-10-29T18:01:00Z","snapshot_observed_at":"2026-07-06T08:33:12.534026Z","submitted_at":"2019-10-29T18:01:00Z","title":"BART: Denoising Sequence-to-Sequence Pre-training for Natural Language Generation, Translation, and Comprehension","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.13461","snapshot_observed_at":"2026-08-07T15:29:38.816322Z","title":"Bart: Denoising sequence-to-sequence pre-training for natural language generation, translation, and comprehension,","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2505.14989","last_updated":"2025-05-21T00:27:38Z","snapshot_observed_at":"2026-08-07T15:23:40.228446Z","submitted_at":"2025-05-21T00:27:38Z","title":"Discrete Audio Representations for Automated Audio Captioning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T15:29:38.816322Z"},"links":{"cited_paper":"/paper/1910.13461","citing_paper":"/paper/2505.14989"},"observation_digest":"sha256:8292df8155c7c94645534307f046de65111147569fb8e82b204d44f600fe106e","observation_id":"f97881d5-1890-40a5-8d5a-44f7c8b214a5","resolution":{"observed_at":"2026-08-07T15:29:38.816322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:29:38.907144Z","title":"Language models are unsupervised multitask learners,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.14989","last_updated":"2025-05-21T00:27:38Z","snapshot_observed_at":"2026-08-07T15:23:40.228446Z","submitted_at":"2025-05-21T00:27:38Z","title":"Discrete Audio Representations for Automated Audio Captioning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T15:29:38.907144Z"},"links":{"citing_paper":"/paper/2505.14989"},"observation_digest":"sha256:b65f6e35699d7f48fbc0127c351dc4f97aa3be195470bab69c7ef93c991c31e4","observation_id":"faeb6c81-bccb-4221-a163-554f51667a31","resolution":{"observed_at":"2026-08-07T15:29:38.907144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02384","last_updated":"2024-09-04T02:20:59Z","snapshot_observed_at":"2026-08-01T18:34:49.824481Z","submitted_at":"2024-09-04T02:20:59Z","title":"STAB: Speech Tokenizer Assessment Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.02384","snapshot_observed_at":"2026-08-07T15:29:39.010252Z","title":"Stab: Speech tokenizer assessment benchmark,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14989","last_updated":"2025-05-21T00:27:38Z","snapshot_observed_at":"2026-08-07T15:23:40.228446Z","submitted_at":"2025-05-21T00:27:38Z","title":"Discrete Audio Representations for Automated Audio Captioning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T15:29:39.010252Z"},"links":{"cited_paper":"/paper/2409.02384","citing_paper":"/paper/2505.14989"},"observation_digest":"sha256:0d18920cc7203cb90394693c6c0981fa1135cf0147e5513ba28b39d8c6166c10","observation_id":"6c960552-04af-4b3a-ba53-1ebb82abe3a5","resolution":{"observed_at":"2026-08-07T15:29:39.010252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:29:39.090136Z","title":"Soundstream: An end-to-end neural audio codec,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.14989","last_updated":"2025-05-21T00:27:38Z","snapshot_observed_at":"2026-08-07T15:23:40.228446Z","submitted_at":"2025-05-21T00:27:38Z","title":"Discrete Audio Representations for Automated Audio Captioning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T15:29:39.090136Z"},"links":{"citing_paper":"/paper/2505.14989"},"observation_digest":"sha256:95d8957879f36b752c4b509ead9a81bea7f11b65f4d9c0eec06e861c5a8ed8d4","observation_id":"1bf8414e-bbe7-412c-926d-3c551e889850","resolution":{"observed_at":"2026-08-07T15:29:39.090136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.13438","last_updated":"2022-10-24T17:52:02Z","snapshot_observed_at":"2026-08-09T07:12:13.721596Z","submitted_at":"2022-10-24T17:52:02Z","title":"High Fidelity Neural Audio Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.13438","snapshot_observed_at":"2026-08-07T15:29:39.236427Z","title":"High fidelity neural audio compression,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.14989","last_updated":"2025-05-21T00:27:38Z","snapshot_observed_at":"2026-08-07T15:23:40.228446Z","submitted_at":"2025-05-21T00:27:38Z","title":"Discrete Audio Representations for Automated Audio Captioning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T15:29:39.236427Z"},"links":{"cited_paper":"/paper/2210.13438","citing_paper":"/paper/2505.14989"},"observation_digest":"sha256:74db96f75231ccc2c2b0510a9594b6974f5da7c1eabf30dcdaa84a5909cb53db","observation_id":"604426d6-34a9-45e0-8b98-d9a7518c4e3a","resolution":{"observed_at":"2026-08-07T15:29:39.236427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:29:39.371761Z","title":"High-fidelity audio compression with improved rvqgan,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14989","last_updated":"2025-05-21T00:27:38Z","snapshot_observed_at":"2026-08-07T15:23:40.228446Z","submitted_at":"2025-05-21T00:27:38Z","title":"Discrete Audio Representations for Automated Audio Captioning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T15:29:39.371761Z"},"links":{"citing_paper":"/paper/2505.14989"},"observation_digest":"sha256:76f66d2e74ff957406089f261574cf79ab7a1fbdbb3f706180afb5383f263344","observation_id":"a635e2e1-ee8c-4774-a573-a3dd8fd5abe8","resolution":{"observed_at":"2026-08-07T15:29:39.371761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:29:39.476168Z","title":"Hubert: Self-supervised speech represen- tation learning by masked prediction of hidden units,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.14989","last_updated":"2025-05-21T00:27:38Z","snapshot_observed_at":"2026-08-07T15:23:40.228446Z","submitted_at":"2025-05-21T00:27:38Z","title":"Discrete Audio Representations for Automated Audio Captioning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T15:29:39.476168Z"},"links":{"citing_paper":"/paper/2505.14989"},"observation_digest":"sha256:f00528a576e55ec93fb75afd4752e592c6b04cd79244a4dcbb37c430c302038a","observation_id":"db345d99-1cc7-44c3-b2e9-cff7d83fdb29","resolution":{"observed_at":"2026-08-07T15:29:39.476168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:29:39.544115Z","title":"Wavlm: Large-scale self- supervised pre-training for full stack speech processing,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.14989","last_updated":"2025-05-21T00:27:38Z","snapshot_observed_at":"2026-08-07T15:23:40.228446Z","submitted_at":"2025-05-21T00:27:38Z","title":"Discrete Audio Representations for Automated Audio Captioning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T15:29:39.544115Z"},"links":{"citing_paper":"/paper/2505.14989"},"observation_digest":"sha256:125889072d3c07988dbb3d889c375b04b2ddbae1435120d734b497da39e5374c","observation_id":"d440acd7-51cc-45cf-99e7-d54ad8af7e6c","resolution":{"observed_at":"2026-08-07T15:29:39.544115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:29:42.290872Z","title":"RepCodec: A speech represen- tation codec for speech tokenization,","venue":null,"work_id":"95b99ea1-19b5-40ef-abb7-ef1c2489351a","year":2024},"citing_paper":{"arxiv_id":"2505.14989","last_updated":"2025-05-21T00:27:38Z","snapshot_observed_at":"2026-08-07T15:23:40.228446Z","submitted_at":"2025-05-21T00:27:38Z","title":"Discrete Audio Representations for Automated Audio Captioning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T15:29:39.614586Z"},"links":{"citing_paper":"/paper/2505.14989"},"observation_digest":"sha256:004ce770437b4288dabd986f0ee7fd36ae7972d692439f081bf0bf6001aa56fc","observation_id":"820f0797-cf0f-4bd5-aad6-9be4af9109d9","resolution":{"observed_at":"2026-08-07T15:29:42.358530Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-07T15:29:39.691319Z","title":"Neural codec language mod- els are zero-shot text to speech synthesizers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14989","last_updated":"2025-05-21T00:27:38Z","snapshot_observed_at":"2026-08-07T15:23:40.228446Z","submitted_at":"2025-05-21T00:27:38Z","title":"Discrete Audio Representations for Automated Audio Captioning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T15:29:39.691319Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2505.14989"},"observation_digest":"sha256:17d76adf1895e67b53cbbe0f7ef04c1710783f19861ee460977cf58e27aa3fd4","observation_id":"2365d3a4-9a06-480b-a9e9-738cec03d94e","resolution":{"observed_at":"2026-08-07T15:29:39.691319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08093","last_updated":"2024-02-15T18:57:26Z","snapshot_observed_at":"2026-07-06T17:29:13.310354Z","submitted_at":"2024-02-12T22:21:30Z","title":"BASE TTS: Lessons from building a billion-parameter Text-to-Speech model on 100K hours of data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08093","snapshot_observed_at":"2026-08-07T15:29:39.917468Z","title":"Base tts: Lessons from building a billion-parameter text-to-speech model on 100k hours of data,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14989","last_updated":"2025-05-21T00:27:38Z","snapshot_observed_at":"2026-08-07T15:23:40.228446Z","submitted_at":"2025-05-21T00:27:38Z","title":"Discrete Audio Representations for Automated Audio Captioning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T15:29:39.917468Z"},"links":{"cited_paper":"/paper/2402.08093","citing_paper":"/paper/2505.14989"},"observation_digest":"sha256:3e28f95a396f05b81fc7c9ef152d947b5fc1d136a12f73dcbb22c47a61263047","observation_id":"7e1079c0-39a2-4f82-bd04-ba21a7d587b4","resolution":{"observed_at":"2026-08-07T15:29:39.917468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:29:42.161399Z","title":"Exploration of efficient end-to-end asr using discretized input from self-supervised learning,","venue":null,"work_id":"ab332195-8989-4f14-9e09-1b30b814b559","year":2023},"citing_paper":{"arxiv_id":"2505.14989","last_updated":"2025-05-21T00:27:38Z","snapshot_observed_at":"2026-08-07T15:23:40.228446Z","submitted_at":"2025-05-21T00:27:38Z","title":"Discrete Audio Representations for Automated Audio Captioning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T15:29:40.021098Z"},"links":{"citing_paper":"/paper/2505.14989"},"observation_digest":"sha256:b889855c6f9126ad75b3b4431cadb10f45a030a0f365b74173a9327ffe565a65","observation_id":"d6434d90-b764-4b0a-b87d-a5606774bcdf","resolution":{"observed_at":"2026-08-07T15:29:42.206416Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:29:40.136058Z","title":"How should we extract discrete audio tokens from self-supervised models?","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14989","last_updated":"2025-05-21T00:27:38Z","snapshot_observed_at":"2026-08-07T15:23:40.228446Z","submitted_at":"2025-05-21T00:27:38Z","title":"Discrete Audio Representations for Automated Audio Captioning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T15:29:40.136058Z"},"links":{"citing_paper":"/paper/2505.14989"},"observation_digest":"sha256:f24199c0d8a9d45f59e741848370d7e9d8084d9b8e293cf31a925b3aa13450fc","observation_id":"9031b10f-1abd-4b2c-9429-6d768514a162","resolution":{"observed_at":"2026-08-07T15:29:40.136058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:29:42.022078Z","title":"Discrete audio representation as an alternative to mel-spectrograms for speaker and speech recognition,","venue":null,"work_id":"e4270c00-4487-401b-8894-a2f4a87c043b","year":2024},"citing_paper":{"arxiv_id":"2505.14989","last_updated":"2025-05-21T00:27:38Z","snapshot_observed_at":"2026-08-07T15:23:40.228446Z","submitted_at":"2025-05-21T00:27:38Z","title":"Discrete Audio Representations for Automated Audio Captioning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T15:29:40.274350Z"},"links":{"citing_paper":"/paper/2505.14989"},"observation_digest":"sha256:0bf3af53a626607c1969d8216a3585adbce2a467e7833b3f99f4cc20f9f6c60e","observation_id":"f071cc86-68db-4404-ba0a-947998171708","resolution":{"observed_at":"2026-08-07T15:29:42.081468Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:29:41.881060Z","title":"Enclap: Combining neu- ral audio codec and audio-text joint embedding for automated au- dio captioning,","venue":null,"work_id":"ce635d33-b793-4361-8cd9-09f41e5a4254","year":2024},"citing_paper":{"arxiv_id":"2505.14989","last_updated":"2025-05-21T00:27:38Z","snapshot_observed_at":"2026-08-07T15:23:40.228446Z","submitted_at":"2025-05-21T00:27:38Z","title":"Discrete Audio Representations for Automated Audio Captioning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T15:29:40.400959Z"},"links":{"citing_paper":"/paper/2505.14989"},"observation_digest":"sha256:3207a153b290336e0065fa45ae77966969e0cfae2486698996fe451a30139ed3","observation_id":"e716f219-6b97-4506-b963-09661381826f","resolution":{"observed_at":"2026-08-07T15:29:41.951056Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:29:40.513005Z","title":"Neural discrete represen- tation learning,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.14989","last_updated":"2025-05-21T00:27:38Z","snapshot_observed_at":"2026-08-07T15:23:40.228446Z","submitted_at":"2025-05-21T00:27:38Z","title":"Discrete Audio Representations for Automated Audio Captioning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T15:29:40.513005Z"},"links":{"citing_paper":"/paper/2505.14989"},"observation_digest":"sha256:86a94649eb7698d26793e486ebc9eda5557e5eb506e1ec2cf866d235635cc9c4","observation_id":"559d8f9d-1118-412f-8dc3-f2ee8e0538a6","resolution":{"observed_at":"2026-08-07T15:29:40.513005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:29:41.781981Z","title":"Investigating lo- cal and global information for automated audio captioning with transfer learning,","venue":null,"work_id":"678ee17e-3d02-4ec6-9d8c-664ad16f31a6","year":2021},"citing_paper":{"arxiv_id":"2505.14989","last_updated":"2025-05-21T00:27:38Z","snapshot_observed_at":"2026-08-07T15:23:40.228446Z","submitted_at":"2025-05-21T00:27:38Z","title":"Discrete Audio Representations for Automated Audio Captioning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T15:29:40.581171Z"},"links":{"citing_paper":"/paper/2505.14989"},"observation_digest":"sha256:db2f90869f5358a731a8e4edbf62fe140ca71b65323191d3c65f392562bb360a","observation_id":"5ca75e92-a442-4ac8-9b6b-6902dbdd3bb9","resolution":{"observed_at":"2026-08-07T15:29:41.823902Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:29:41.647697Z","title":"Prefix tuning for auto- mated audio captioning,","venue":null,"work_id":"40a7fc63-04fd-4e8f-bb01-7a35163d4140","year":2023},"citing_paper":{"arxiv_id":"2505.14989","last_updated":"2025-05-21T00:27:38Z","snapshot_observed_at":"2026-08-07T15:23:40.228446Z","submitted_at":"2025-05-21T00:27:38Z","title":"Discrete Audio Representations for Automated Audio Captioning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T15:29:40.658035Z"},"links":{"citing_paper":"/paper/2505.14989"},"observation_digest":"sha256:c3e4a6b26a4493ede5b4c1cf2494c1dbca7c06885b88df111665d640cedec624","observation_id":"a11eb655-7160-47d5-9313-fe082c58d128","resolution":{"observed_at":"2026-08-07T15:29:41.713383Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:29:40.769821Z","title":"Audio set: An ontology and human-labeled dataset for audio events,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.14989","last_updated":"2025-05-21T00:27:38Z","snapshot_observed_at":"2026-08-07T15:23:40.228446Z","submitted_at":"2025-05-21T00:27:38Z","title":"Discrete Audio Representations for Automated Audio Captioning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T15:29:40.769821Z"},"links":{"citing_paper":"/paper/2505.14989"},"observation_digest":"sha256:92964160f478db263c2a5ac63aba2909e807456f4e09fa864ea8814ec914aa72","observation_id":"fa09ffca-3051-4b66-b7ac-c9a49cbceec3","resolution":{"observed_at":"2026-08-07T15:29:40.769821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:29:40.890406Z","title":"Clotho: An audio cap- tioning dataset,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.14989","last_updated":"2025-05-21T00:27:38Z","snapshot_observed_at":"2026-08-07T15:23:40.228446Z","submitted_at":"2025-05-21T00:27:38Z","title":"Discrete Audio Representations for Automated Audio Captioning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T15:29:40.890406Z"},"links":{"citing_paper":"/paper/2505.14989"},"observation_digest":"sha256:4270eb828cb53f7995effb6e0fca2fc48e4d57d1c8197f651877870bef1a275d","observation_id":"6c7a4798-49e0-4a63-8e6a-5c18735ef4c8","resolution":{"observed_at":"2026-08-07T15:29:40.890406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:29:40.981070Z","title":"Improved image captioning via policy gradient optimization of spider,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.14989","last_updated":"2025-05-21T00:27:38Z","snapshot_observed_at":"2026-08-07T15:23:40.228446Z","submitted_at":"2025-05-21T00:27:38Z","title":"Discrete Audio Representations for Automated Audio Captioning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T15:29:40.981070Z"},"links":{"citing_paper":"/paper/2505.14989"},"observation_digest":"sha256:d9a5e544e21f1cf309eee968786fc380f4d7681e391546df7ca2fe309599acde","observation_id":"ca949e47-509f-4b35-9b34-a44501a28463","resolution":{"observed_at":"2026-08-07T15:29:40.981070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:29:41.472383Z","title":"Can audio captions be evaluated with image caption metrics?","venue":null,"work_id":"908294f5-4f51-4024-a6e6-060187c323aa","year":2022},"citing_paper":{"arxiv_id":"2505.14989","last_updated":"2025-05-21T00:27:38Z","snapshot_observed_at":"2026-08-07T15:23:40.228446Z","submitted_at":"2025-05-21T00:27:38Z","title":"Discrete Audio Representations for Automated Audio Captioning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T15:29:41.089739Z"},"links":{"citing_paper":"/paper/2505.14989"},"observation_digest":"sha256:79f0965b6d4c1158e344b219eab7975883628c2131432a98a3e086c02dff952f","observation_id":"5e43b8e5-c476-4d03-a339-29dcf1715581","resolution":{"observed_at":"2026-08-07T15:29:41.528936Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.14989","last_updated":"2025-05-21T00:27:38Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-07T15:23:40.228446Z","submitted_at":"2025-05-21T00:27:38Z","title":"Discrete Audio Representations for Automated Audio Captioning"},"reference_resolution":{"displayed":36,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":18,"verified_exact":1,"verified_fuzzy":17},"total_outbound_references":36},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 36 of 36 outbound references and 1 inbound Pith citation observation for arXiv:2505.14989."}