{"as_of":"2026-08-10T15:02:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7b0f598605148d94b1c52548416c9a5611a5010e511650746c816558bf07ed8c","coverage":[{"denominator":39,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":39,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:01:35.993878Z","state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:01:33.023609Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T12:01:36.150100Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.00800","last_updated":"2025-06-01T03:01:16Z","snapshot_observed_at":"2026-08-07T23:25:02.559135Z","submitted_at":"2025-06-01T03:01:16Z","title":"CLAP-ART: Automated Audio Captioning with Semantic-rich Audio Representation Tokenizer","version":1},"cited_work":{"arxiv_id":"2506.00800","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.00800","snapshot_observed_at":"2026-08-07T12:01:36.150100Z","title":"CLAP-ART: Automated Audio Captioning with Semantic-rich Audio Representation Tokenizer","venue":"eess.AS","work_id":"f694bd23-1829-4bef-9ce5-018a6384971b","year":2025},"citing_paper":{"arxiv_id":"2506.00800","last_updated":"2025-06-01T03:01:16Z","snapshot_observed_at":"2026-08-07T23:25:02.559135Z","submitted_at":"2025-06-01T03:01:16Z","title":"CLAP-ART: Automated Audio Captioning with Semantic-rich Audio Representation Tokenizer","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:33.023609Z"},"links":{"cited_paper":"/paper/2506.00800","citing_paper":"/paper/2506.00800"},"observation_digest":"sha256:69c565c3b6cd700f4747a66bd6f967bd1e07a65bc455e205cc8fbad317a1278f","observation_id":"d9fec535-2a2f-45d1-8589-33a4efdc3814","resolution":{"observed_at":"2026-08-07T12:01:36.208170Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.00800/citation-record","integrity":"/paper/2506.00800/integrity","json":"/paper/2506.00800/citation-record.json","paper":"/paper/2506.00800"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.00800","last_updated":"2025-06-01T03:01:16Z","snapshot_observed_at":"2026-08-07T23:25:02.559135Z","submitted_at":"2025-06-01T03:01:16Z","title":"CLAP-ART: Automated Audio Captioning with Semantic-rich Audio Representation Tokenizer","version":1},"cited_work":{"arxiv_id":"2506.00800","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.00800","snapshot_observed_at":"2026-08-07T12:01:36.150100Z","title":"CLAP-ART: Automated Audio Captioning with Semantic-rich Audio Representation Tokenizer","venue":"eess.AS","work_id":"f694bd23-1829-4bef-9ce5-018a6384971b","year":2025},"citing_paper":{"arxiv_id":"2506.00800","last_updated":"2025-06-01T03:01:16Z","snapshot_observed_at":"2026-08-07T23:25:02.559135Z","submitted_at":"2025-06-01T03:01:16Z","title":"CLAP-ART: Automated Audio Captioning with Semantic-rich Audio Representation Tokenizer","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:33.023609Z"},"links":{"cited_paper":"/paper/2506.00800","citing_paper":"/paper/2506.00800"},"observation_digest":"sha256:69c565c3b6cd700f4747a66bd6f967bd1e07a65bc455e205cc8fbad317a1278f","observation_id":"d9fec535-2a2f-45d1-8589-33a4efdc3814","resolution":{"observed_at":"2026-08-07T12:01:36.208170Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:40.668205Z","title":"Automated Audio Captioning Methods using Pre- trained Language Model Pre-trained language models have been utilized in some stud- ies to improve AAC performance [4–11]","venue":null,"work_id":"d7cf8e78-54ab-426d-a7dd-28ccb93227e5","year":null},"citing_paper":{"arxiv_id":"2506.00800","last_updated":"2025-06-01T03:01:16Z","snapshot_observed_at":"2026-08-07T23:25:02.559135Z","submitted_at":"2025-06-01T03:01:16Z","title":"CLAP-ART: Automated Audio Captioning with Semantic-rich Audio Representation Tokenizer","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:33.069426Z"},"links":{"citing_paper":"/paper/2506.00800"},"observation_digest":"sha256:e4872606a41ae8f698e10f482b72c63c24dea0ded43e8a97f5695646e30b0d29","observation_id":"c26a34a6-401c-444b-b56b-9d4426b7316c","resolution":{"observed_at":"2026-08-07T12:01:40.671760Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:40.658678Z","title":"First, En- CLAP transforms an input audio waveform into a CLAP audio embedding and EnCodec discrete tokens","venue":null,"work_id":"303fdaf7-7f53-433b-874f-562a98b5ff3f","year":null},"citing_paper":{"arxiv_id":"2506.00800","last_updated":"2025-06-01T03:01:16Z","snapshot_observed_at":"2026-08-07T23:25:02.559135Z","submitted_at":"2025-06-01T03:01:16Z","title":"CLAP-ART: Automated Audio Captioning with Semantic-rich Audio Representation Tokenizer","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:33.141557Z"},"links":{"citing_paper":"/paper/2506.00800"},"observation_digest":"sha256:d9c65e443aa9f5a2d75afcc2b41f57bf1b9e0517f3fdf44c0ef06601c7caf7fc","observation_id":"22ad47f7-076f-4c97-94c5-2ddeb94a5f13","resolution":{"observed_at":"2026-08-07T12:01:40.662089Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:40.649312Z","title":null,"venue":null,"work_id":"976a24bf-6496-4b09-9108-00c47670cb32","year":null},"citing_paper":{"arxiv_id":"2506.00800","last_updated":"2025-06-01T03:01:16Z","snapshot_observed_at":"2026-08-07T23:25:02.559135Z","submitted_at":"2025-06-01T03:01:16Z","title":"CLAP-ART: Automated Audio Captioning with Semantic-rich Audio Representation Tokenizer","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:33.268808Z"},"links":{"citing_paper":"/paper/2506.00800"},"observation_digest":"sha256:7d7e90f14a172e8b8ceb0f6972745e3e2392e1b07d0745166303f54f3d8d4010","observation_id":"2b899848-a6e9-43d5-a3ab-5cb4e692de14","resolution":{"observed_at":"2026-08-07T12:01:40.652837Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:40.640403Z","title":"Experimental Setup We conducted experiments on two AAC datasets: Audio- Caps [23] and Clotho [24]","venue":null,"work_id":"e638ba76-fb27-41d5-b6b4-21a3a7be9ee5","year":null},"citing_paper":{"arxiv_id":"2506.00800","last_updated":"2025-06-01T03:01:16Z","snapshot_observed_at":"2026-08-07T23:25:02.559135Z","submitted_at":"2025-06-01T03:01:16Z","title":"CLAP-ART: Automated Audio Captioning with Semantic-rich Audio Representation Tokenizer","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:33.325366Z"},"links":{"citing_paper":"/paper/2506.00800"},"observation_digest":"sha256:84de6a2e3c1edbb7470fbe2c43d05e5a50be188bce90f63ec1cd7444e90922dd","observation_id":"d9178af3-636b-4d95-b1ab-9fbb316c1c21","resolution":{"observed_at":"2026-08-07T12:01:40.643800Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:40.630388Z","title":"semantic-rich and discrete","venue":null,"work_id":"4c2ffba3-c5ce-4080-af5c-da67baf19f54","year":null},"citing_paper":{"arxiv_id":"2506.00800","last_updated":"2025-06-01T03:01:16Z","snapshot_observed_at":"2026-08-07T23:25:02.559135Z","submitted_at":"2025-06-01T03:01:16Z","title":"CLAP-ART: Automated Audio Captioning with Semantic-rich Audio Representation Tokenizer","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:33.360355Z"},"links":{"citing_paper":"/paper/2506.00800"},"observation_digest":"sha256:708a72701593cc7a093a4d1f526b0c94fb78745a47956352699935b65f19c90d","observation_id":"c9cbd217-355f-43af-8165-8c4a49217fbf","resolution":{"observed_at":"2026-08-07T12:01:40.633679Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:40.621068Z","title":null,"venue":null,"work_id":"b143b796-59e2-4b9c-8d89-87cb7928e5be","year":null},"citing_paper":{"arxiv_id":"2506.00800","last_updated":"2025-06-01T03:01:16Z","snapshot_observed_at":"2026-08-07T23:25:02.559135Z","submitted_at":"2025-06-01T03:01:16Z","title":"CLAP-ART: Automated Audio Captioning with Semantic-rich Audio Representation Tokenizer","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:33.427951Z"},"links":{"citing_paper":"/paper/2506.00800"},"observation_digest":"sha256:0b9832ba0e63bc562540ea363d93e38295280d2071150dc9efb6a5ba40c3248f","observation_id":"e5b382c7-cdf9-45c2-ae30-53407d95080f","resolution":{"observed_at":"2026-08-07T12:01:40.624033Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:40.612387Z","title":"Automated audio captioning with recurrent neural networks,","venue":null,"work_id":"0a580d42-6a77-4dcf-b438-8f77c573f16d","year":2017},"citing_paper":{"arxiv_id":"2506.00800","last_updated":"2025-06-01T03:01:16Z","snapshot_observed_at":"2026-08-07T23:25:02.559135Z","submitted_at":"2025-06-01T03:01:16Z","title":"CLAP-ART: Automated Audio Captioning with Semantic-rich Audio Representation Tokenizer","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:33.508524Z"},"links":{"citing_paper":"/paper/2506.00800"},"observation_digest":"sha256:d52583c27824a0b59e1851fdc7b3e2e3e0e211d63726b8788102efd1c3747c2e","observation_id":"2b8053d3-a6a5-4e22-bdb8-2f33fd944383","resolution":{"observed_at":"2026-08-07T12:01:40.615126Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:40.603713Z","title":"Automated audio captioning: An overview of recent progress and new challenges,","venue":null,"work_id":"0dfeeb9e-3228-417f-b1e6-d745435e7619","year":2022},"citing_paper":{"arxiv_id":"2506.00800","last_updated":"2025-06-01T03:01:16Z","snapshot_observed_at":"2026-08-07T23:25:02.559135Z","submitted_at":"2025-06-01T03:01:16Z","title":"CLAP-ART: Automated Audio Captioning with Semantic-rich Audio Representation Tokenizer","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:33.600862Z"},"links":{"citing_paper":"/paper/2506.00800"},"observation_digest":"sha256:efc2a93004f28968442d018d65f4b44dddec79dd316fe72a578095a9a9fa139a","observation_id":"21aaba24-c546-4ab3-a3fd-5ecc41bf560d","resolution":{"observed_at":"2026-08-07T12:01:40.606743Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:40.593822Z","title":"Beyond the status quo: A contemporary survey of advances and challenges in audio cap- tioning,","venue":null,"work_id":"82b6483d-4701-40b1-9df9-d1ae4017169c","year":2024},"citing_paper":{"arxiv_id":"2506.00800","last_updated":"2025-06-01T03:01:16Z","snapshot_observed_at":"2026-08-07T23:25:02.559135Z","submitted_at":"2025-06-01T03:01:16Z","title":"CLAP-ART: Automated Audio Captioning with Semantic-rich Audio Representation Tokenizer","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:33.656600Z"},"links":{"citing_paper":"/paper/2506.00800"},"observation_digest":"sha256:1464106adb8e96844892bedf13a4736f93d758b9190a2697ef4d60cedf303df3","observation_id":"327d26fd-73b7-45c0-9581-f4d75e449ba1","resolution":{"observed_at":"2026-08-07T12:01:40.597069Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.07331","last_updated":"2020-12-14T08:27:36Z","snapshot_observed_at":"2026-08-08T13:06:58.498161Z","submitted_at":"2020-12-14T08:27:36Z","title":"Audio Captioning using Pre-Trained Large-Scale Language Model Guided by Audio-based Similar Caption Retrieval","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.07331","snapshot_observed_at":"2026-08-07T12:01:33.727705Z","title":"Audio captioning using pre-trained large-scale language model guided by audio-based similar caption retrieval,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2506.00800","last_updated":"2025-06-01T03:01:16Z","snapshot_observed_at":"2026-08-07T23:25:02.559135Z","submitted_at":"2025-06-01T03:01:16Z","title":"CLAP-ART: Automated Audio Captioning with Semantic-rich Audio Representation Tokenizer","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:33.727705Z"},"links":{"cited_paper":"/paper/2012.07331","citing_paper":"/paper/2506.00800"},"observation_digest":"sha256:93082ca65220b09ed0de4300a6b96d5bca87f7581a0d4701a1bfa98264c08240","observation_id":"c32a6fbe-9650-4e07-b6a3-7baa2371cee5","resolution":{"observed_at":"2026-08-07T12:01:33.727705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:40.583090Z","title":"Automated audio cap- tioning by fine-tuning bart with audioset tags,","venue":null,"work_id":"da7255cd-73e2-4b5f-8de1-57972b7a748c","year":2021},"citing_paper":{"arxiv_id":"2506.00800","last_updated":"2025-06-01T03:01:16Z","snapshot_observed_at":"2026-08-07T23:25:02.559135Z","submitted_at":"2025-06-01T03:01:16Z","title":"CLAP-ART: Automated Audio Captioning with Semantic-rich Audio Representation Tokenizer","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:33.801814Z"},"links":{"citing_paper":"/paper/2506.00800"},"observation_digest":"sha256:ecbb6d353590ad0e5b89d30e9bc8698b384a5cac3b4118b9e4d66c2a0751aca5","observation_id":"b6605451-fc0a-494c-abe4-d485ddffa251","resolution":{"observed_at":"2026-08-07T12:01:40.586909Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:40.509723Z","title":"Enclap: Combining neural audio codec and audio-text joint embedding for automated audio captioning,","venue":null,"work_id":"43657336-96fe-4c4e-8f5e-9ff132126835","year":2024},"citing_paper":{"arxiv_id":"2506.00800","last_updated":"2025-06-01T03:01:16Z","snapshot_observed_at":"2026-08-07T23:25:02.559135Z","submitted_at":"2025-06-01T03:01:16Z","title":"CLAP-ART: Automated Audio Captioning with Semantic-rich Audio Representation Tokenizer","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:33.866374Z"},"links":{"citing_paper":"/paper/2506.00800"},"observation_digest":"sha256:83c61d9ca4519f406b230fad2eed595539c03567fe7c06c78120ef0dd83ff74a","observation_id":"405f177c-82a0-4e4f-b9b0-fbffb039535e","resolution":{"observed_at":"2026-08-07T12:01:40.572547Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:40.257404Z","title":"Wavcaps: A chatgpt-assisted weakly- labelled audio captioning dataset for audio-language multimodal research,","venue":null,"work_id":"9c9e7128-b0a7-4f7c-ad6e-9980e1866402","year":2024},"citing_paper":{"arxiv_id":"2506.00800","last_updated":"2025-06-01T03:01:16Z","snapshot_observed_at":"2026-08-07T23:25:02.559135Z","submitted_at":"2025-06-01T03:01:16Z","title":"CLAP-ART: Automated Audio Captioning with Semantic-rich Audio Representation Tokenizer","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:33.905971Z"},"links":{"citing_paper":"/paper/2506.00800"},"observation_digest":"sha256:fb2eda36d61223e6b4d5db0c462680ca127724beba3cb64b1a1e42e5f1c9d6fc","observation_id":"b04eacd2-2fe4-4413-a3e5-caf3b85c35fb","resolution":{"observed_at":"2026-08-07T12:01:40.432143Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:40.195759Z","title":"Improving audio captioning models with fine- grained audio features, text embedding supervision, and llm mix- up augmentation,","venue":null,"work_id":"8fae9209-964d-4057-94fc-cdb97f418ad9","year":2024},"citing_paper":{"arxiv_id":"2506.00800","last_updated":"2025-06-01T03:01:16Z","snapshot_observed_at":"2026-08-07T23:25:02.559135Z","submitted_at":"2025-06-01T03:01:16Z","title":"CLAP-ART: Automated Audio Captioning with Semantic-rich Audio Representation Tokenizer","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:33.966127Z"},"links":{"citing_paper":"/paper/2506.00800"},"observation_digest":"sha256:415c8cd97ee866266732e11cdcdd9cac4a4b8b28fa473aa1872b24d8f08ee71d","observation_id":"fd3a5ab3-c46d-4b97-8b81-c063f3e49c89","resolution":{"observed_at":"2026-08-07T12:01:40.220996Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:40.081221Z","title":"Recap: Retrieval-augmented audio captioning,","venue":null,"work_id":"5a4b39e4-7ee4-4217-a7eb-be01b77030e7","year":2024},"citing_paper":{"arxiv_id":"2506.00800","last_updated":"2025-06-01T03:01:16Z","snapshot_observed_at":"2026-08-07T23:25:02.559135Z","submitted_at":"2025-06-01T03:01:16Z","title":"CLAP-ART: Automated Audio Captioning with Semantic-rich Audio Representation Tokenizer","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:34.051316Z"},"links":{"citing_paper":"/paper/2506.00800"},"observation_digest":"sha256:2a83b9d0bb4701e9e94cd8fb30535bfdef2eb24ce4381898dc31030a73c5cfb4","observation_id":"0199daa7-7f7b-48a3-8f11-3e7babeef12a","resolution":{"observed_at":"2026-08-07T12:01:40.143102Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19388","last_updated":"2025-04-16T17:40:22Z","snapshot_observed_at":"2026-08-10T03:27:46.172940Z","submitted_at":"2024-06-27T17:58:54Z","title":"Taming Data and Transformers for Audio Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19388","snapshot_observed_at":"2026-08-07T12:01:34.136572Z","title":"Taming data and transformers for audio generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00800","last_updated":"2025-06-01T03:01:16Z","snapshot_observed_at":"2026-08-07T23:25:02.559135Z","submitted_at":"2025-06-01T03:01:16Z","title":"CLAP-ART: Automated Audio Captioning with Semantic-rich Audio Representation Tokenizer","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:34.136572Z"},"links":{"cited_paper":"/paper/2406.19388","citing_paper":"/paper/2506.00800"},"observation_digest":"sha256:2db7d5dccf89c271e883188d660e6e82d7dece7635b732655ab8f7ed690d70a6","observation_id":"ab9921c6-7f27-4813-8fdb-9715031c8ae5","resolution":{"observed_at":"2026-08-07T12:01:34.136572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:39.845992Z","title":"Enhancing automated audio captioning via large language models with optimized audio encoding,","venue":null,"work_id":"05353160-eded-45c6-9b47-1614e6f2b8ec","year":2024},"citing_paper":{"arxiv_id":"2506.00800","last_updated":"2025-06-01T03:01:16Z","snapshot_observed_at":"2026-08-07T23:25:02.559135Z","submitted_at":"2025-06-01T03:01:16Z","title":"CLAP-ART: Automated Audio Captioning with Semantic-rich Audio Representation Tokenizer","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:34.232063Z"},"links":{"citing_paper":"/paper/2506.00800"},"observation_digest":"sha256:df589fdcf3d0331df79c160903e6454597bf758ee57f4f7c097cff181a8eae56","observation_id":"95fd2992-8ce8-463c-ad70-4910f955bce7","resolution":{"observed_at":"2026-08-07T12:01:39.973182Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:39.718677Z","title":"BEATs: Audio pre-training with acoustic tokenizers,","venue":null,"work_id":"228643e5-3a5a-4f20-a41e-216b13028c83","year":2023},"citing_paper":{"arxiv_id":"2506.00800","last_updated":"2025-06-01T03:01:16Z","snapshot_observed_at":"2026-08-07T23:25:02.559135Z","submitted_at":"2025-06-01T03:01:16Z","title":"CLAP-ART: Automated Audio Captioning with Semantic-rich Audio Representation Tokenizer","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:34.312586Z"},"links":{"citing_paper":"/paper/2506.00800"},"observation_digest":"sha256:284fdba99227f656b0cb41870b3c3367a6caf9fc96c220629d6646c75f4cd5be","observation_id":"e5fb0d28-9ed9-4735-b5bf-fa0b242bd93f","resolution":{"observed_at":"2026-08-07T12:01:39.792153Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:39.501958Z","title":"Audio Set: An ontology and human-labeled dataset for audio events,","venue":null,"work_id":"90cba74e-64e6-4c45-9e28-0ee1c49c12d9","year":2017},"citing_paper":{"arxiv_id":"2506.00800","last_updated":"2025-06-01T03:01:16Z","snapshot_observed_at":"2026-08-07T23:25:02.559135Z","submitted_at":"2025-06-01T03:01:16Z","title":"CLAP-ART: Automated Audio Captioning with Semantic-rich Audio Representation Tokenizer","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:34.374746Z"},"links":{"citing_paper":"/paper/2506.00800"},"observation_digest":"sha256:e4917b78d031c36f663a2bdaacafae86e4452b6a50e9dee9b35f9c687dfb4ccd","observation_id":"1c71dbdf-29d1-4713-b39f-5cc7e576fecd","resolution":{"observed_at":"2026-08-07T12:01:39.645364Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:39.333180Z","title":"Large-scale contrastive language-audio pretraining with feature fusion and keyword-to-caption augmentation,","venue":null,"work_id":"2f5838a5-f844-456c-984d-a7e1bf36ea81","year":2023},"citing_paper":{"arxiv_id":"2506.00800","last_updated":"2025-06-01T03:01:16Z","snapshot_observed_at":"2026-08-07T23:25:02.559135Z","submitted_at":"2025-06-01T03:01:16Z","title":"CLAP-ART: Automated Audio Captioning with Semantic-rich Audio Representation Tokenizer","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:34.445594Z"},"links":{"citing_paper":"/paper/2506.00800"},"observation_digest":"sha256:f1b6bdf9342f5f4c05f714e75a5188516913a519c742b05ff764777cbeb586e2","observation_id":"0e361f16-f008-4518-b797-c9ae4fd2cf9d","resolution":{"observed_at":"2026-08-07T12:01:39.413088Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:39.065453Z","title":"High fidelity neural audio compression,","venue":null,"work_id":"c4c04fd9-f18c-472f-b937-c8b7de1a1f73","year":2023},"citing_paper":{"arxiv_id":"2506.00800","last_updated":"2025-06-01T03:01:16Z","snapshot_observed_at":"2026-08-07T23:25:02.559135Z","submitted_at":"2025-06-01T03:01:16Z","title":"CLAP-ART: Automated Audio Captioning with Semantic-rich Audio Representation Tokenizer","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:34.506940Z"},"links":{"citing_paper":"/paper/2506.00800"},"observation_digest":"sha256:69e5e8ec962d86f01ff68b1e9601a5d2f3c109d5f4d693cf60a274c4590246b0","observation_id":"849d4c47-fa88-4064-a327-d07ebe4e913d","resolution":{"observed_at":"2026-08-07T12:01:39.203206Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:38.813246Z","title":"BART: Denoising sequence-to-sequence pre-training for natural language genera- tion, translation, and comprehension,","venue":null,"work_id":"a8a50cdc-ff77-4a1a-80a0-731c431d3f92","year":2020},"citing_paper":{"arxiv_id":"2506.00800","last_updated":"2025-06-01T03:01:16Z","snapshot_observed_at":"2026-08-07T23:25:02.559135Z","submitted_at":"2025-06-01T03:01:16Z","title":"CLAP-ART: Automated Audio Captioning with Semantic-rich Audio Representation Tokenizer","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:34.589090Z"},"links":{"citing_paper":"/paper/2506.00800"},"observation_digest":"sha256:42d2149d3e0028bddbfe94528566a608087bd3735493d584d7d2f95432648b8a","observation_id":"39e2a501-5016-464b-ac77-b9882674171b","resolution":{"observed_at":"2026-08-07T12:01:38.968506Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00233","last_updated":"2024-11-28T12:31:04Z","snapshot_observed_at":"2026-07-06T18:08:00.410061Z","submitted_at":"2024-04-30T22:51:36Z","title":"SemantiCodec: An Ultra Low Bitrate Semantic Audio Codec for General Sound","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.00233","snapshot_observed_at":"2026-08-07T12:01:34.694185Z","title":"Semanticodec: An ultra low bitrate semantic audio codec for general sound,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00800","last_updated":"2025-06-01T03:01:16Z","snapshot_observed_at":"2026-08-07T23:25:02.559135Z","submitted_at":"2025-06-01T03:01:16Z","title":"CLAP-ART: Automated Audio Captioning with Semantic-rich Audio Representation Tokenizer","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:34.694185Z"},"links":{"cited_paper":"/paper/2405.00233","citing_paper":"/paper/2506.00800"},"observation_digest":"sha256:92e3470b8dcfcdb844dd130a5c4886a9de833731ec33ba25f54aa461141d7fd0","observation_id":"7244c56a-c1e5-4a44-bd02-48dcc4a1123e","resolution":{"observed_at":"2026-08-07T12:01:34.694185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:38.585306Z","title":"Speechtok- enizer: Unified speech tokenizer for speech language models,","venue":null,"work_id":"0c7d0fc4-a503-4326-99ed-84f4d93dac10","year":2024},"citing_paper":{"arxiv_id":"2506.00800","last_updated":"2025-06-01T03:01:16Z","snapshot_observed_at":"2026-08-07T23:25:02.559135Z","submitted_at":"2025-06-01T03:01:16Z","title":"CLAP-ART: Automated Audio Captioning with Semantic-rich Audio Representation Tokenizer","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:34.783763Z"},"links":{"citing_paper":"/paper/2506.00800"},"observation_digest":"sha256:dc3fed46fab198025009327a1d6a01c7c52dea10de07c75bb789ef65e814e75f","observation_id":"1daff668-6f25-4c57-859f-d70c503c2e27","resolution":{"observed_at":"2026-08-07T12:01:38.710089Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:38.274072Z","title":"Hubert: Self-supervised speech representation learning by masked prediction of hidden units,","venue":null,"work_id":"6b5cf204-b18e-4155-b240-0ff87162c18c","year":2021},"citing_paper":{"arxiv_id":"2506.00800","last_updated":"2025-06-01T03:01:16Z","snapshot_observed_at":"2026-08-07T23:25:02.559135Z","submitted_at":"2025-06-01T03:01:16Z","title":"CLAP-ART: Automated Audio Captioning with Semantic-rich Audio Representation Tokenizer","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:34.886016Z"},"links":{"citing_paper":"/paper/2506.00800"},"observation_digest":"sha256:41ca5bae7106e8408e79a8b0d29339945099f6c378916a5012a9f4f972d199da","observation_id":"825707c1-2a9f-4374-806e-0fcdaa537847","resolution":{"observed_at":"2026-08-07T12:01:38.416120Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:38.137526Z","title":"SoundStream: An end-to-end neural audio codec,","venue":null,"work_id":"3d853843-3142-474f-b32c-3fdfb46109ec","year":2022},"citing_paper":{"arxiv_id":"2506.00800","last_updated":"2025-06-01T03:01:16Z","snapshot_observed_at":"2026-08-07T23:25:02.559135Z","submitted_at":"2025-06-01T03:01:16Z","title":"CLAP-ART: Automated Audio Captioning with Semantic-rich Audio Representation Tokenizer","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:34.967305Z"},"links":{"citing_paper":"/paper/2506.00800"},"observation_digest":"sha256:3b733ed6fa778df01dd3c77d1f68354232d9f43db76ad6e0ab674022fd94bceb","observation_id":"dde80387-82ca-484d-9e41-15118b8e9377","resolution":{"observed_at":"2026-08-07T12:01:38.234586Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:37.958579Z","title":"vq- wav2vec: Self-supervised learning of discrete speech representa- tions,","venue":null,"work_id":"8d0987b5-8f75-4772-a706-611d3ae81a9b","year":2020},"citing_paper":{"arxiv_id":"2506.00800","last_updated":"2025-06-01T03:01:16Z","snapshot_observed_at":"2026-08-07T23:25:02.559135Z","submitted_at":"2025-06-01T03:01:16Z","title":"CLAP-ART: Automated Audio Captioning with Semantic-rich Audio Representation Tokenizer","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:35.045177Z"},"links":{"citing_paper":"/paper/2506.00800"},"observation_digest":"sha256:85c36d4b4eb4bce61a0b85d2ca6918e2b48401b7b7b7749723c891b963522c73","observation_id":"cad56588-70cf-4805-afe2-cb9b317a6268","resolution":{"observed_at":"2026-08-07T12:01:38.051717Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:37.803967Z","title":"How should we extract discrete audio tokens from self-supervised models?,","venue":null,"work_id":"8afc0918-ff93-4d63-af3e-e58fadb342ee","year":2024},"citing_paper":{"arxiv_id":"2506.00800","last_updated":"2025-06-01T03:01:16Z","snapshot_observed_at":"2026-08-07T23:25:02.559135Z","submitted_at":"2025-06-01T03:01:16Z","title":"CLAP-ART: Automated Audio Captioning with Semantic-rich Audio Representation Tokenizer","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:35.127376Z"},"links":{"citing_paper":"/paper/2506.00800"},"observation_digest":"sha256:9747f0af6ca8bca6472a6cf339497db801a1ec4138f20d7fec188671735b017b","observation_id":"dacc8b28-076a-42f1-999d-7607c3e29081","resolution":{"observed_at":"2026-08-07T12:01:37.876465Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:37.650393Z","title":"Audiocaps: Generating captions for audios in the wild,","venue":null,"work_id":"ecebdd45-e89b-4981-a580-b09c4df743b4","year":2019},"citing_paper":{"arxiv_id":"2506.00800","last_updated":"2025-06-01T03:01:16Z","snapshot_observed_at":"2026-08-07T23:25:02.559135Z","submitted_at":"2025-06-01T03:01:16Z","title":"CLAP-ART: Automated Audio Captioning with Semantic-rich Audio Representation Tokenizer","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:35.207642Z"},"links":{"citing_paper":"/paper/2506.00800"},"observation_digest":"sha256:69feaf533bd9fb234b0805899b4482e21f24c0dfadb374da207afd6d06a6babc","observation_id":"a310985e-a820-492c-96f7-f08ca33af77f","resolution":{"observed_at":"2026-08-07T12:01:37.725909Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:37.459383Z","title":"Clotho: An audio cap- tioning dataset,","venue":null,"work_id":"b165f1ae-8c18-42d6-a70d-bfd843ed2508","year":2020},"citing_paper":{"arxiv_id":"2506.00800","last_updated":"2025-06-01T03:01:16Z","snapshot_observed_at":"2026-08-07T23:25:02.559135Z","submitted_at":"2025-06-01T03:01:16Z","title":"CLAP-ART: Automated Audio Captioning with Semantic-rich Audio Representation Tokenizer","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:35.295830Z"},"links":{"citing_paper":"/paper/2506.00800"},"observation_digest":"sha256:8b0009ffb57315166262fb2ee747f9836fcc4f3bc0feedb3070dd5301483571a","observation_id":"6b35c6c1-310e-4ee6-8a4e-c1c384c400d2","resolution":{"observed_at":"2026-08-07T12:01:37.529375Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-09T20:34:52.923500Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-07T12:01:35.359333Z","title":"Decoupled weight decay regulariza- tion,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.00800","last_updated":"2025-06-01T03:01:16Z","snapshot_observed_at":"2026-08-07T23:25:02.559135Z","submitted_at":"2025-06-01T03:01:16Z","title":"CLAP-ART: Automated Audio Captioning with Semantic-rich Audio Representation Tokenizer","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:35.359333Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2506.00800"},"observation_digest":"sha256:d59b6a48e287cff278f274b14f5dda7548e2c43be06ea2c5d878f9e3156aa066","observation_id":"78e4e4d8-f205-4695-a62a-f2b7e767aa50","resolution":{"observed_at":"2026-08-07T12:01:35.359333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:37.284167Z","title":"Meteor universal: Language spe- cific translation evaluation for any target language,","venue":null,"work_id":"347ee875-8ccb-4b13-a2a9-9594e349f88e","year":2014},"citing_paper":{"arxiv_id":"2506.00800","last_updated":"2025-06-01T03:01:16Z","snapshot_observed_at":"2026-08-07T23:25:02.559135Z","submitted_at":"2025-06-01T03:01:16Z","title":"CLAP-ART: Automated Audio Captioning with Semantic-rich Audio Representation Tokenizer","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:35.442458Z"},"links":{"citing_paper":"/paper/2506.00800"},"observation_digest":"sha256:4b7bd064dddff8442e9debffc52aee996e8c10ea19d70f1fdcee5791d5ceed37","observation_id":"e32cd370-503b-4519-ad3a-18545a2f37e6","resolution":{"observed_at":"2026-08-07T12:01:37.362079Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:37.125482Z","title":"CIDEr: Consensus-based image description evaluation,","venue":null,"work_id":"3d07bccc-4f03-4cb6-b8b8-1d2ca3297547","year":2015},"citing_paper":{"arxiv_id":"2506.00800","last_updated":"2025-06-01T03:01:16Z","snapshot_observed_at":"2026-08-07T23:25:02.559135Z","submitted_at":"2025-06-01T03:01:16Z","title":"CLAP-ART: Automated Audio Captioning with Semantic-rich Audio Representation Tokenizer","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:35.563960Z"},"links":{"citing_paper":"/paper/2506.00800"},"observation_digest":"sha256:122a1720d20900c1fb52b9ec05c2aaa2a5d1121a4b7522873683db358cd532cb","observation_id":"61ddb5b5-50de-4892-bba4-d68103ef3633","resolution":{"observed_at":"2026-08-07T12:01:37.197754Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:36.952743Z","title":"SPICE: Semantic propositional image caption evaluation,","venue":null,"work_id":"7f95bb87-10ff-4c4f-890d-74b1818981a4","year":2016},"citing_paper":{"arxiv_id":"2506.00800","last_updated":"2025-06-01T03:01:16Z","snapshot_observed_at":"2026-08-07T23:25:02.559135Z","submitted_at":"2025-06-01T03:01:16Z","title":"CLAP-ART: Automated Audio Captioning with Semantic-rich Audio Representation Tokenizer","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:35.643613Z"},"links":{"citing_paper":"/paper/2506.00800"},"observation_digest":"sha256:2d32c5eef117eda01c234fbdc964b2066f9346533b1403330f5c3845b6cf7e2d","observation_id":"89e7d13c-cac2-43b4-b452-0bba65e4a275","resolution":{"observed_at":"2026-08-07T12:01:37.030840Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:36.767599Z","title":"Improved image captioning via policy gradient optimization of spider,","venue":null,"work_id":"7b03fa94-66d6-414a-b789-220221124136","year":2017},"citing_paper":{"arxiv_id":"2506.00800","last_updated":"2025-06-01T03:01:16Z","snapshot_observed_at":"2026-08-07T23:25:02.559135Z","submitted_at":"2025-06-01T03:01:16Z","title":"CLAP-ART: Automated Audio Captioning with Semantic-rich Audio Representation Tokenizer","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:35.725864Z"},"links":{"citing_paper":"/paper/2506.00800"},"observation_digest":"sha256:5e9cb6cb49b02c24ce2ddbabc0145be31f98314e2cf9e99747b17a74644acaf8","observation_id":"a78f4136-0a21-428d-a152-04d6e1cace00","resolution":{"observed_at":"2026-08-07T12:01:36.844380Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:36.623668Z","title":"Can audio captions be evaluated with image caption metrics?,","venue":null,"work_id":"0bca6486-b32d-4662-8063-387a7a0a9649","year":2022},"citing_paper":{"arxiv_id":"2506.00800","last_updated":"2025-06-01T03:01:16Z","snapshot_observed_at":"2026-08-07T23:25:02.559135Z","submitted_at":"2025-06-01T03:01:16Z","title":"CLAP-ART: Automated Audio Captioning with Semantic-rich Audio Representation Tokenizer","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:35.799846Z"},"links":{"citing_paper":"/paper/2506.00800"},"observation_digest":"sha256:c6113b1cb3056b911cc48ff4adb536dd6f0a73dc8e9cf848d28ab89a035fddbc","observation_id":"ffd1cc54-6e51-4411-8c84-438a46ef7573","resolution":{"observed_at":"2026-08-07T12:01:36.701552Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:36.475716Z","title":"Enclap++: Ana- lyzing the enclap framework for optimizing automated audio cap- tioning performance,","venue":null,"work_id":"f9f5db32-2781-4196-86c6-631c70060eb1","year":2024},"citing_paper":{"arxiv_id":"2506.00800","last_updated":"2025-06-01T03:01:16Z","snapshot_observed_at":"2026-08-07T23:25:02.559135Z","submitted_at":"2025-06-01T03:01:16Z","title":"CLAP-ART: Automated Audio Captioning with Semantic-rich Audio Representation Tokenizer","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:35.906298Z"},"links":{"citing_paper":"/paper/2506.00800"},"observation_digest":"sha256:3aa5e020c9a94d8ca7a3ae7f863898bc0ce94e7b32e1c4d1dad86060316120d7","observation_id":"0e90ee26-cb6f-4015-84ee-ea6ba9f10b91","resolution":{"observed_at":"2026-08-07T12:01:36.552520Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:36.284937Z","title":"Slam-aac: Enhancing audio captioning with paraphras- ing augmentation and clap-refine through llms,","venue":null,"work_id":"57ab8105-8905-4792-b3ee-2b3c62b7f023","year":2025},"citing_paper":{"arxiv_id":"2506.00800","last_updated":"2025-06-01T03:01:16Z","snapshot_observed_at":"2026-08-07T23:25:02.559135Z","submitted_at":"2025-06-01T03:01:16Z","title":"CLAP-ART: Automated Audio Captioning with Semantic-rich Audio Representation Tokenizer","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:35.993878Z"},"links":{"citing_paper":"/paper/2506.00800"},"observation_digest":"sha256:ffb908baf8ce47d3d97febb5e53acb4479996483e92bfdd868e587173efab692","observation_id":"0a1131d4-b1e1-4a29-91fa-1082570c3239","resolution":{"observed_at":"2026-08-07T12:01:36.366008Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.00800","last_updated":"2025-06-01T03:01:16Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-07T23:25:02.559135Z","submitted_at":"2025-06-01T03:01:16Z","title":"CLAP-ART: Automated Audio Captioning with Semantic-rich Audio Representation Tokenizer"},"reference_resolution":{"displayed":39,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":6,"verified_exact":0,"verified_fuzzy":32},"total_outbound_references":39},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 39 of 39 outbound references and 1 inbound Pith citation observation for arXiv:2506.00800."}