Pith. sign in

Paper Citation Record · LEDGER

Vision Language Models Are Few-Shot Audio Spectrogram Classifiers

As of 14 August 2026, this Paper Citation Record lists 19 of 19 outbound references and 1 inbound Pith citation observation for arXiv:2411.12058.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2411.12058 v1

Coverage vector

measured 19 of 19 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-12T18:02:17.907076Z

measured 20 of 20 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-14T06:32:32.682623+00:00

measured 1 of 1 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-05T05:12:48.603860Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: pith, observed 2026-08-05T05:12:48.684609Z

Reference resolution

19 of 19 outbound references displayed

  • verified exact0
  • verified fuzzy10
  • unresolved9
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 84a94cad-1bac-40a1-a253-4d03a51f6d88 · outbound

This paper cites GPT-4 Technical Report.

Vision Language Models Are Few-Shot Audio Spectrogram Classifiers GPT-4 Technical Report

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-12T18:02:17.760917Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T18:02:17.760917Z digest=sha256:0a6b42fc938eba443ed50ee4c4c6619cd833338a53a31e20e3aa1e289ae4739c

Observation c6d603cf-8af9-4c41-b8bd-d6a9861370f4 · outbound

This paper cites The claude 3 model family: Opus, sonnet, haiku.

Vision Language Models Are Few-Shot Audio Spectrogram Classifiers The claude 3 model family: Opus, sonnet, haiku

Reference 2

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T18:02:18.398895Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-12T18:02:17.771784Z digest=sha256:63bc66c6b1d0d2af564458b12cb27a5b23cf776359e2db7a7d92ebdd92b94f5f

Observation 9ecb54c4-d082-4cb3-8c54-6e78759b9407 · outbound

This paper cites an unresolved cited work.

Vision Language Models Are Few-Shot Audio Spectrogram Classifiers Unresolved cited work

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-12T18:02:17.782307Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T18:02:17.782307Z digest=sha256:c1dfc0101ffe05b0e20d42f1b792b13e3457a5f32da014a24e72e869c011e7a2

Observation fb34f316-b7c8-493c-a508-18ed37a2ec27 · outbound

This paper cites Convolutional recurrent neural networks for music classification, 2016.

Vision Language Models Are Few-Shot Audio Spectrogram Classifiers Convolutional recurrent neural networks for music classification, 2016

Reference 4

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T18:02:18.368205Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-12T18:02:17.793996Z digest=sha256:b15f43a111bea59d9664492b4d17fa3da42fbf5f8a4780316c57d9d4158ce64b

Observation 09169264-1425-4151-87d9-911d618b1ced · outbound

This paper cites Pengi: An audio language model for audio tasks, 2024.

Vision Language Models Are Few-Shot Audio Spectrogram Classifiers Pengi: An audio language model for audio tasks, 2024

Reference 5

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T18:02:18.334025Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-12T18:02:17.799387Z digest=sha256:c1d15e871159abfd30a5eb92325ce8fdf96404ea811e279b78a6149cdeb8b734

Observation fa67ffe7-38db-4906-b790-6ae62503d303 · outbound

This paper cites A survey on in-context learning, 2024.

Vision Language Models Are Few-Shot Audio Spectrogram Classifiers A survey on in-context learning, 2024

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-12T18:02:17.805480Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T18:02:17.805480Z digest=sha256:4c431338b3bb67417448482097f1af8c8422cead4f3f05d25539b2be08374127

Observation fe6ed44f-6557-40e5-b82e-fd172199735e · outbound

This paper cites Clotho: an audio captioning dataset.

Vision Language Models Are Few-Shot Audio Spectrogram Classifiers Clotho: an audio captioning dataset

Reference 7

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T18:02:18.290817Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-12T18:02:17.810251Z digest=sha256:9e13ddf0ca02caed1d5ad6893603da77b55f67688b6add27f09129b7469ba01e

Observation a5127ce9-90dd-4d0a-9bdb-246047bd707d · outbound

This paper cites A survey of vision-language pre-trained models.

Vision Language Models Are Few-Shot Audio Spectrogram Classifiers A survey of vision-language pre-trained models

Reference 8

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T18:02:18.273649Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-12T18:02:17.815157Z digest=sha256:02a08b6cb9f1e3f665d2982eb369db63f832ac94a058cb6f6611b504bfee57e6

Observation bfb2794c-6194-45a8-84c0-2282716afd6d · outbound

This paper cites The Llama 3 Herd of Models.

Vision Language Models Are Few-Shot Audio Spectrogram Classifiers The Llama 3 Herd of Models

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-12T18:02:17.820714Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T18:02:17.820714Z digest=sha256:4f242e3a135ef4d59594bf9d64a699b01b45085e79fdbd8f358d25fee1307fff

Observation dd2d327e-83b2-438e-9962-52dbbeeb07f7 · outbound

This paper cites Gama: A large audio-language model with advanced audio understanding and complex reasoning abilities, 2024.

Vision Language Models Are Few-Shot Audio Spectrogram Classifiers Gama: A large audio-language model with advanced audio understanding and complex reasoning abilities, 2024

Reference 10

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T18:02:18.238625Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-12T18:02:17.825609Z digest=sha256:daaf7040aaf00719ec8dbd1cb7be3b920e69dd344eefc1e813d8f7edfa7c49ba

Observation 56ecca0c-d76a-4ebc-9fcc-1a6ac6b0c67a · outbound

This paper cites Ast: Audio spectrogram transformer, 2021.

Vision Language Models Are Few-Shot Audio Spectrogram Classifiers Ast: Audio spectrogram transformer, 2021

Reference 11

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T18:02:18.209595Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-12T18:02:17.833785Z digest=sha256:2fc10121d16d2f70dfa9d94f55b6df19199c4f374c04bac43d0a9d019d62cfa2

Observation 8c941e31-7bbe-41eb-a9a8-1bcbd1041893 · outbound

This paper cites an unresolved cited work.

Vision Language Models Are Few-Shot Audio Spectrogram Classifiers Unresolved cited work

Reference 12

Resolution
unresolved
raw_fallback, observed 2026-08-12T18:02:18.185250Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-12T18:02:17.854158Z digest=sha256:dc235b5344e8b1b1c2ee44aae3c45f4990e1c30a7d36d888422d964e9631426c

Observation 57caf24e-b710-47b1-bec7-d3cdef154cbe · outbound

This paper cites Effectiveness assessment of recent large vision-language models, 2024.

Vision Language Models Are Few-Shot Audio Spectrogram Classifiers Effectiveness assessment of recent large vision-language models, 2024

Reference 13

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T18:02:18.163060Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-12T18:02:17.865346Z digest=sha256:dc9409e16e82236ec5c8556f7ab6e8049ae7205ca60cdd86629bec0059a320e0

Observation 5de494b3-ae2a-4ad2-b90e-dc859b8169b5 · outbound

This paper cites Esc: Dataset for environmental sound classification.

Vision Language Models Are Few-Shot Audio Spectrogram Classifiers Esc: Dataset for environmental sound classification

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-12T18:02:17.871519Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T18:02:17.871519Z digest=sha256:88f8cc51f60401a4ccd55becf71956cec4fcfe564f1c455d5177ddd689e5a60e

Observation 80d5344d-843b-4a97-938b-4092e8bf42ed · outbound

This paper cites End-to-end learning for music audio tagging at scale.

Vision Language Models Are Few-Shot Audio Spectrogram Classifiers End-to-end learning for music audio tagging at scale

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-12T18:02:17.876163Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T18:02:17.876163Z digest=sha256:9ddd46e113a069250c8a5550bb04bd1fb3e70a0991f239a291c72de6e15d6fbb

Observation 2b5c505f-5176-40b8-b079-3bd78ea8b4d0 · outbound

This paper cites Salmonn: Towards generic hearing abilities for large language models, 2024.

Vision Language Models Are Few-Shot Audio Spectrogram Classifiers Salmonn: Towards generic hearing abilities for large language models, 2024

Reference 16

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T18:02:18.124031Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-12T18:02:17.885366Z digest=sha256:b7fd3668d165e02b761a3eabc8407480b9b7bad4071a193466a958aac19e1b40

Observation 7bd0f064-9bac-4d7e-a2d3-bbef2dc266fd · outbound

This paper cites Gemini: A Family of Highly Capable Multimodal Models.

Vision Language Models Are Few-Shot Audio Spectrogram Classifiers Gemini: A Family of Highly Capable Multimodal Models

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-12T18:02:17.892307Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T18:02:17.892307Z digest=sha256:6d23e3a8e019bdba9d71f666f5420b14fea2d1bcbdadf3aa078d88a1c17bb9ae

Observation 276b9982-83a7-4438-9ddf-cad58e3b63f3 · outbound

This paper cites Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for expert agi, 2024.

Vision Language Models Are Few-Shot Audio Spectrogram Classifiers Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for expert agi, 2024

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-12T18:02:17.900560Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T18:02:17.900560Z digest=sha256:b67fd68755f307f000162e6fc74370b1e97d822108b79489b04e2908f0afd267

Observation ed514dd4-678b-4298-8268-e0147a4ee7f6 · outbound

This paper cites "" 2 { 3.

Vision Language Models Are Few-Shot Audio Spectrogram Classifiers "" 2 { 3

Reference 19

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T18:02:18.072232Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-12T18:02:17.907076Z digest=sha256:ec4787cc4fb00c62eb90b74c25a33aeec998d7ea075149ad3fca8798d47a6a94

Pith citing papers

Observation 23b033b1-833f-4248-8e28-7bdae6be5854 · inbound

Knowledge-Augmented Vision Language Models for Underwater Bioacoustic Spectrogram Analysis cites this paper.

Knowledge-Augmented Vision Language Models for Underwater Bioacoustic Spectrogram Analysis Vision Language Models Are Few-Shot Audio Spectrogram Classifiers

Reference 8

Resolution
verified exact
local_arxiv, observed 2026-08-05T05:12:48.690095Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-05T05:12:48.603860Z digest=sha256:4b4ebff4e4fba89f15dbfd4c09fb877538629b35df859306a19ae26f2f7a1dea