{"as_of":"2026-08-14T11:10:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9683ab57f8fe8c3bffb3a67fe17b1391b11da78fa75aa4e33e64bc961c3f9425","coverage":[{"denominator":19,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":19,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T18:02:17.907076Z","state":"measured"},{"denominator":20,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":20,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T05:12:48.603860Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-05T05:12:48.684609Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.12058","last_updated":"2024-11-18T20:56:44Z","snapshot_observed_at":"2026-08-13T11:20:44.116201Z","submitted_at":"2024-11-18T20:56:44Z","title":"Vision Language Models Are Few-Shot Audio Spectrogram Classifiers","version":1},"cited_work":{"arxiv_id":"2411.12058","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.12058","snapshot_observed_at":"2026-08-05T05:12:48.684609Z","title":"Vision Language Models Are Few-Shot Audio Spectrogram Classifiers","venue":"cs.SD","work_id":"d57e20c9-ed01-4324-85b7-6016f8d7d6f9","year":2024},"citing_paper":{"arxiv_id":"2509.05703","last_updated":"2025-09-06T12:36:59Z","snapshot_observed_at":"2026-08-11T00:42:38.402440Z","submitted_at":"2025-09-06T12:36:59Z","title":"Knowledge-Augmented Vision Language Models for Underwater Bioacoustic Spectrogram Analysis","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T05:12:48.603860Z"},"links":{"cited_paper":"/paper/2411.12058","citing_paper":"/paper/2509.05703"},"observation_digest":"sha256:4b4ebff4e4fba89f15dbfd4c09fb877538629b35df859306a19ae26f2f7a1dea","observation_id":"23b033b1-833f-4248-8e28-7bdae6be5854","resolution":{"observed_at":"2026-08-05T05:12:48.690095Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2411.12058/citation-record","integrity":"/paper/2411.12058/integrity","json":"/paper/2411.12058/citation-record.json","paper":"/paper/2411.12058"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-12T18:02:17.760917Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.12058","last_updated":"2024-11-18T20:56:44Z","snapshot_observed_at":"2026-08-13T11:20:44.116201Z","submitted_at":"2024-11-18T20:56:44Z","title":"Vision Language Models Are Few-Shot Audio Spectrogram Classifiers","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T18:02:17.760917Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2411.12058"},"observation_digest":"sha256:0a6b42fc938eba443ed50ee4c4c6619cd833338a53a31e20e3aa1e289ae4739c","observation_id":"84a94cad-1bac-40a1-a253-4d03a51f6d88","resolution":{"observed_at":"2026-08-12T18:02:17.760917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:02:18.392213Z","title":"The claude 3 model family: Opus, sonnet, haiku","venue":null,"work_id":"1deeb438-1c90-4142-8ede-2f110ff1b6cc","year":2024},"citing_paper":{"arxiv_id":"2411.12058","last_updated":"2024-11-18T20:56:44Z","snapshot_observed_at":"2026-08-13T11:20:44.116201Z","submitted_at":"2024-11-18T20:56:44Z","title":"Vision Language Models Are Few-Shot Audio Spectrogram Classifiers","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T18:02:17.771784Z"},"links":{"citing_paper":"/paper/2411.12058"},"observation_digest":"sha256:63bc66c6b1d0d2af564458b12cb27a5b23cf776359e2db7a7d92ebdd92b94f5f","observation_id":"c6d603cf-8af9-4c41-b8bd-d6a9861370f4","resolution":{"observed_at":"2026-08-12T18:02:18.398895Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:02:17.782307Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.12058","last_updated":"2024-11-18T20:56:44Z","snapshot_observed_at":"2026-08-13T11:20:44.116201Z","submitted_at":"2024-11-18T20:56:44Z","title":"Vision Language Models Are Few-Shot Audio Spectrogram Classifiers","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T18:02:17.782307Z"},"links":{"citing_paper":"/paper/2411.12058"},"observation_digest":"sha256:c1dfc0101ffe05b0e20d42f1b792b13e3457a5f32da014a24e72e869c011e7a2","observation_id":"9ecb54c4-d082-4cb3-8c54-6e78759b9407","resolution":{"observed_at":"2026-08-12T18:02:17.782307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:02:18.362845Z","title":"Convolutional recurrent neural networks for music classification, 2016","venue":null,"work_id":"433bdc88-1c08-42e3-8a36-b4f44d10e5b3","year":2016},"citing_paper":{"arxiv_id":"2411.12058","last_updated":"2024-11-18T20:56:44Z","snapshot_observed_at":"2026-08-13T11:20:44.116201Z","submitted_at":"2024-11-18T20:56:44Z","title":"Vision Language Models Are Few-Shot Audio Spectrogram Classifiers","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T18:02:17.793996Z"},"links":{"citing_paper":"/paper/2411.12058"},"observation_digest":"sha256:b15f43a111bea59d9664492b4d17fa3da42fbf5f8a4780316c57d9d4158ce64b","observation_id":"fb34f316-b7c8-493c-a508-18ed37a2ec27","resolution":{"observed_at":"2026-08-12T18:02:18.368205Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:02:18.328916Z","title":"Pengi: An audio language model for audio tasks, 2024","venue":null,"work_id":"53f592e4-45cf-4217-adff-120825a8540a","year":2024},"citing_paper":{"arxiv_id":"2411.12058","last_updated":"2024-11-18T20:56:44Z","snapshot_observed_at":"2026-08-13T11:20:44.116201Z","submitted_at":"2024-11-18T20:56:44Z","title":"Vision Language Models Are Few-Shot Audio Spectrogram Classifiers","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T18:02:17.799387Z"},"links":{"citing_paper":"/paper/2411.12058"},"observation_digest":"sha256:c1d15e871159abfd30a5eb92325ce8fdf96404ea811e279b78a6149cdeb8b734","observation_id":"09169264-1425-4151-87d9-911d618b1ced","resolution":{"observed_at":"2026-08-12T18:02:18.334025Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:02:17.805480Z","title":"A survey on in-context learning, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.12058","last_updated":"2024-11-18T20:56:44Z","snapshot_observed_at":"2026-08-13T11:20:44.116201Z","submitted_at":"2024-11-18T20:56:44Z","title":"Vision Language Models Are Few-Shot Audio Spectrogram Classifiers","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T18:02:17.805480Z"},"links":{"citing_paper":"/paper/2411.12058"},"observation_digest":"sha256:4c431338b3bb67417448482097f1af8c8422cead4f3f05d25539b2be08374127","observation_id":"fa67ffe7-38db-4906-b790-6ae62503d303","resolution":{"observed_at":"2026-08-12T18:02:17.805480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:02:18.284963Z","title":"Clotho: an audio captioning dataset","venue":null,"work_id":"49f2239b-8b4e-4e75-b7a2-26202687cdb2","year":2020},"citing_paper":{"arxiv_id":"2411.12058","last_updated":"2024-11-18T20:56:44Z","snapshot_observed_at":"2026-08-13T11:20:44.116201Z","submitted_at":"2024-11-18T20:56:44Z","title":"Vision Language Models Are Few-Shot Audio Spectrogram Classifiers","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T18:02:17.810251Z"},"links":{"citing_paper":"/paper/2411.12058"},"observation_digest":"sha256:9e13ddf0ca02caed1d5ad6893603da77b55f67688b6add27f09129b7469ba01e","observation_id":"fe6ed44f-6557-40e5-b82e-fd172199735e","resolution":{"observed_at":"2026-08-12T18:02:18.290817Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:02:18.263162Z","title":"A survey of vision-language pre-trained models","venue":null,"work_id":"9a9be3df-a826-4a58-bbc5-95efe185a604","year":2022},"citing_paper":{"arxiv_id":"2411.12058","last_updated":"2024-11-18T20:56:44Z","snapshot_observed_at":"2026-08-13T11:20:44.116201Z","submitted_at":"2024-11-18T20:56:44Z","title":"Vision Language Models Are Few-Shot Audio Spectrogram Classifiers","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T18:02:17.815157Z"},"links":{"citing_paper":"/paper/2411.12058"},"observation_digest":"sha256:02a08b6cb9f1e3f665d2982eb369db63f832ac94a058cb6f6611b504bfee57e6","observation_id":"a5127ce9-90dd-4d0a-9bdb-246047bd707d","resolution":{"observed_at":"2026-08-12T18:02:18.273649Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-12T18:02:17.820714Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.12058","last_updated":"2024-11-18T20:56:44Z","snapshot_observed_at":"2026-08-13T11:20:44.116201Z","submitted_at":"2024-11-18T20:56:44Z","title":"Vision Language Models Are Few-Shot Audio Spectrogram Classifiers","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T18:02:17.820714Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2411.12058"},"observation_digest":"sha256:4f242e3a135ef4d59594bf9d64a699b01b45085e79fdbd8f358d25fee1307fff","observation_id":"bfb2794c-6194-45a8-84c0-2282716afd6d","resolution":{"observed_at":"2026-08-12T18:02:17.820714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:02:18.223045Z","title":"Gama: A large audio-language model with advanced audio understanding and complex reasoning abilities, 2024","venue":null,"work_id":"24558d0c-47c9-4ba0-ae4e-598534ff17b9","year":2024},"citing_paper":{"arxiv_id":"2411.12058","last_updated":"2024-11-18T20:56:44Z","snapshot_observed_at":"2026-08-13T11:20:44.116201Z","submitted_at":"2024-11-18T20:56:44Z","title":"Vision Language Models Are Few-Shot Audio Spectrogram Classifiers","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T18:02:17.825609Z"},"links":{"citing_paper":"/paper/2411.12058"},"observation_digest":"sha256:daaf7040aaf00719ec8dbd1cb7be3b920e69dd344eefc1e813d8f7edfa7c49ba","observation_id":"dd2d327e-83b2-438e-9962-52dbbeeb07f7","resolution":{"observed_at":"2026-08-12T18:02:18.238625Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:02:18.201457Z","title":"Ast: Audio spectrogram transformer, 2021","venue":null,"work_id":"72e8118f-a440-4861-a8aa-d48e65800566","year":2021},"citing_paper":{"arxiv_id":"2411.12058","last_updated":"2024-11-18T20:56:44Z","snapshot_observed_at":"2026-08-13T11:20:44.116201Z","submitted_at":"2024-11-18T20:56:44Z","title":"Vision Language Models Are Few-Shot Audio Spectrogram Classifiers","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T18:02:17.833785Z"},"links":{"citing_paper":"/paper/2411.12058"},"observation_digest":"sha256:2fc10121d16d2f70dfa9d94f55b6df19199c4f374c04bac43d0a9d019d62cfa2","observation_id":"56ecca0c-d76a-4ebc-9fcc-1a6ac6b0c67a","resolution":{"observed_at":"2026-08-12T18:02:18.209595Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:02:18.176563Z","title":null,"venue":null,"work_id":"5d6cff2d-129a-4284-a016-c41211be0f6e","year":2017},"citing_paper":{"arxiv_id":"2411.12058","last_updated":"2024-11-18T20:56:44Z","snapshot_observed_at":"2026-08-13T11:20:44.116201Z","submitted_at":"2024-11-18T20:56:44Z","title":"Vision Language Models Are Few-Shot Audio Spectrogram Classifiers","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T18:02:17.854158Z"},"links":{"citing_paper":"/paper/2411.12058"},"observation_digest":"sha256:dc235b5344e8b1b1c2ee44aae3c45f4990e1c30a7d36d888422d964e9631426c","observation_id":"8c941e31-7bbe-41eb-a9a8-1bcbd1041893","resolution":{"observed_at":"2026-08-12T18:02:18.185250Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:02:18.157769Z","title":"Effectiveness assessment of recent large vision-language models, 2024","venue":null,"work_id":"85885596-aadc-4a45-a202-ca8c66febac2","year":2024},"citing_paper":{"arxiv_id":"2411.12058","last_updated":"2024-11-18T20:56:44Z","snapshot_observed_at":"2026-08-13T11:20:44.116201Z","submitted_at":"2024-11-18T20:56:44Z","title":"Vision Language Models Are Few-Shot Audio Spectrogram Classifiers","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T18:02:17.865346Z"},"links":{"citing_paper":"/paper/2411.12058"},"observation_digest":"sha256:dc9409e16e82236ec5c8556f7ab6e8049ae7205ca60cdd86629bec0059a320e0","observation_id":"57caf24e-b710-47b1-bec7-d3cdef154cbe","resolution":{"observed_at":"2026-08-12T18:02:18.163060Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:02:17.871519Z","title":"Esc: Dataset for environmental sound classification","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2411.12058","last_updated":"2024-11-18T20:56:44Z","snapshot_observed_at":"2026-08-13T11:20:44.116201Z","submitted_at":"2024-11-18T20:56:44Z","title":"Vision Language Models Are Few-Shot Audio Spectrogram Classifiers","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T18:02:17.871519Z"},"links":{"citing_paper":"/paper/2411.12058"},"observation_digest":"sha256:88f8cc51f60401a4ccd55becf71956cec4fcfe564f1c455d5177ddd689e5a60e","observation_id":"5de494b3-ae2a-4ad2-b90e-dc859b8169b5","resolution":{"observed_at":"2026-08-12T18:02:17.871519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.02520","last_updated":"2018-06-15T08:04:37Z","snapshot_observed_at":"2026-07-06T06:08:12.462084Z","submitted_at":"2017-11-07T15:10:39Z","title":"End-to-end learning for music audio tagging at scale","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.02520","snapshot_observed_at":"2026-08-12T18:02:17.876163Z","title":"Schmidt, Andreas F","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.12058","last_updated":"2024-11-18T20:56:44Z","snapshot_observed_at":"2026-08-13T11:20:44.116201Z","submitted_at":"2024-11-18T20:56:44Z","title":"Vision Language Models Are Few-Shot Audio Spectrogram Classifiers","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T18:02:17.876163Z"},"links":{"cited_paper":"/paper/1711.02520","citing_paper":"/paper/2411.12058"},"observation_digest":"sha256:bc7ad9968637496192af5aff2d99928e447743aaedd926cadcfda3ded05ad3ce","observation_id":"80d5344d-843b-4a97-938b-4092e8bf42ed","resolution":{"observed_at":"2026-08-12T18:02:17.876163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:02:18.115675Z","title":"Salmonn: Towards generic hearing abilities for large language models, 2024","venue":null,"work_id":"8588a51a-0a0f-4eca-92ca-839c9faf54cb","year":2024},"citing_paper":{"arxiv_id":"2411.12058","last_updated":"2024-11-18T20:56:44Z","snapshot_observed_at":"2026-08-13T11:20:44.116201Z","submitted_at":"2024-11-18T20:56:44Z","title":"Vision Language Models Are Few-Shot Audio Spectrogram Classifiers","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T18:02:17.885366Z"},"links":{"citing_paper":"/paper/2411.12058"},"observation_digest":"sha256:b7fd3668d165e02b761a3eabc8407480b9b7bad4071a193466a958aac19e1b40","observation_id":"2b5c505f-5176-40b8-b079-3bd78ea8b4d0","resolution":{"observed_at":"2026-08-12T18:02:18.124031Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-12T18:02:17.892307Z","title":"Gemini: a family of highly capable multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.12058","last_updated":"2024-11-18T20:56:44Z","snapshot_observed_at":"2026-08-13T11:20:44.116201Z","submitted_at":"2024-11-18T20:56:44Z","title":"Vision Language Models Are Few-Shot Audio Spectrogram Classifiers","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T18:02:17.892307Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2411.12058"},"observation_digest":"sha256:6d23e3a8e019bdba9d71f666f5420b14fea2d1bcbdadf3aa078d88a1c17bb9ae","observation_id":"7bd0f064-9bac-4d7e-a2d3-bbef2dc266fd","resolution":{"observed_at":"2026-08-12T18:02:17.892307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:02:17.900560Z","title":"Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for expert agi, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.12058","last_updated":"2024-11-18T20:56:44Z","snapshot_observed_at":"2026-08-13T11:20:44.116201Z","submitted_at":"2024-11-18T20:56:44Z","title":"Vision Language Models Are Few-Shot Audio Spectrogram Classifiers","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T18:02:17.900560Z"},"links":{"citing_paper":"/paper/2411.12058"},"observation_digest":"sha256:b67fd68755f307f000162e6fc74370b1e97d822108b79489b04e2908f0afd267","observation_id":"276b9982-83a7-4438-9ddf-cad58e3b63f3","resolution":{"observed_at":"2026-08-12T18:02:17.900560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:02:18.059639Z","title":"\"\" 2 { 3","venue":null,"work_id":"ebc0e6df-7bae-4b6d-b12d-646043cd8ca8","year":2024},"citing_paper":{"arxiv_id":"2411.12058","last_updated":"2024-11-18T20:56:44Z","snapshot_observed_at":"2026-08-13T11:20:44.116201Z","submitted_at":"2024-11-18T20:56:44Z","title":"Vision Language Models Are Few-Shot Audio Spectrogram Classifiers","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T18:02:17.907076Z"},"links":{"citing_paper":"/paper/2411.12058"},"observation_digest":"sha256:ec4787cc4fb00c62eb90b74c25a33aeec998d7ea075149ad3fca8798d47a6a94","observation_id":"ed514dd4-678b-4298-8268-e0147a4ee7f6","resolution":{"observed_at":"2026-08-12T18:02:18.072232Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.12058","last_updated":"2024-11-18T20:56:44Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-13T11:20:44.116201Z","submitted_at":"2024-11-18T20:56:44Z","title":"Vision Language Models Are Few-Shot Audio Spectrogram Classifiers"},"reference_resolution":{"displayed":19,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":9,"verified_exact":0,"verified_fuzzy":10},"total_outbound_references":19},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 19 of 19 outbound references and 1 inbound Pith citation observation for arXiv:2411.12058."}