{"as_of":"2026-08-22T09:16:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:53596b78940ea4618e389be22f52de2dfe9d46585e15e908ed937f9eaf8987ef","coverage":[{"denominator":20,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":20,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T23:14:57.714512Z","state":"measured"},{"denominator":22,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":22,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T10:23:37.367700Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-05T21:55:00.563579Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.05335","last_updated":"2025-06-08T18:21:26Z","snapshot_observed_at":"2026-08-21T12:51:56.879148Z","submitted_at":"2025-05-08T15:27:43Z","title":"FLAM: Frame-Wise Language-Audio Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.05335","snapshot_observed_at":"2026-08-06T10:23:37.367700Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.00123","last_updated":"2025-07-31T19:23:57Z","snapshot_observed_at":"2026-08-18T15:56:34.454774Z","submitted_at":"2025-07-31T19:23:57Z","title":"Melody-Lyrics Matching with Contrastive Alignment Loss","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:37.367700Z"},"links":{"cited_paper":"/paper/2505.05335","citing_paper":"/paper/2508.00123"},"observation_digest":"sha256:89946aefa01f85edd8e50381c90d1f747cff9f3fc97ef6006473837b1b9673b1","observation_id":"f5ee9494-cf1b-4d4a-9f89-20a716f4fc31","resolution":{"observed_at":"2026-08-06T10:23:37.367700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.05335","last_updated":"2025-06-08T18:21:26Z","snapshot_observed_at":"2026-08-21T12:51:56.879148Z","submitted_at":"2025-05-08T15:27:43Z","title":"FLAM: Frame-Wise Language-Audio Modeling","version":2},"cited_work":{"arxiv_id":"2505.05335","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.05335","snapshot_observed_at":"2026-08-05T21:55:00.563579Z","title":"FLAM: Frame-Wise Language-Audio Modeling","venue":"cs.SD","work_id":"547395b7-81eb-43ab-8ba3-6f1d93afb6ff","year":2025},"citing_paper":{"arxiv_id":"2508.07829","last_updated":"2025-08-11T10:25:58Z","snapshot_observed_at":"2026-08-21T12:52:12.200460Z","submitted_at":"2025-08-11T10:25:58Z","title":"Auditory Intelligence: Understanding the World Through Sound","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-05T21:55:00.164281Z"},"links":{"cited_paper":"/paper/2505.05335","citing_paper":"/paper/2508.07829"},"observation_digest":"sha256:df03b7c9f67fd2288a6edbf265c20b9a3516b793102fc29c25b4dec6386c2b42","observation_id":"f3f7fd21-81b5-464d-82dc-1d6b272b7750","resolution":{"observed_at":"2026-08-05T21:55:00.654739Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.05335/citation-record","integrity":"/paper/2505.05335/integrity","json":"/paper/2505.05335/citation-record.json","paper":"/paper/2505.05335"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:14:57.836355Z","title":"keyword, tag","venue":null,"work_id":"83ec6bae-eed4-453f-8ff9-52782d9da18b","year":2021},"citing_paper":{"arxiv_id":"2505.05335","last_updated":"2025-06-08T18:21:26Z","snapshot_observed_at":"2026-08-21T12:51:56.879148Z","submitted_at":"2025-05-08T15:27:43Z","title":"FLAM: Frame-Wise Language-Audio Modeling","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T23:14:57.709975Z"},"links":{"citing_paper":"/paper/2505.05335"},"observation_digest":"sha256:b054e31715e3246b9b80af8bf9d4838bac994d6cf54dffe469ed62f2b66e12b1","observation_id":"967a5c6c-c212-49f0-a4a7-7c49e9fabb8d","resolution":{"observed_at":"2026-08-15T23:14:57.840610Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:14:57.659853Z","title":"Clap learning audio concepts from natural language su- pervision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.05335","last_updated":"2025-06-08T18:21:26Z","snapshot_observed_at":"2026-08-21T12:51:56.879148Z","submitted_at":"2025-05-08T15:27:43Z","title":"FLAM: Frame-Wise Language-Audio Modeling","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T23:14:57.659853Z"},"links":{"citing_paper":"/paper/2505.05335"},"observation_digest":"sha256:9bd8f6195d4b6aa2a639c5d1fc755a24647dc11c82ec75ee766a0b207b282e82","observation_id":"c90fbfa0-e57c-493d-b1fc-ad9a8689d44d","resolution":{"observed_at":"2026-08-15T23:14:57.659853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:14:57.898608Z","title":"P., Fonseca, E., Jansen, A., Liu, C., Moore, R","venue":null,"work_id":"84369a64-f5f3-4dc5-85a9-d8ac890411b7","year":2021},"citing_paper":{"arxiv_id":"2505.05335","last_updated":"2025-06-08T18:21:26Z","snapshot_observed_at":"2026-08-21T12:51:56.879148Z","submitted_at":"2025-05-08T15:27:43Z","title":"FLAM: Frame-Wise Language-Audio Modeling","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T23:14:57.663216Z"},"links":{"citing_paper":"/paper/2505.05335"},"observation_digest":"sha256:b2cd1250c01c721ab05711bca8f2b889db26b75f1e4d3aee658e95fe2e062a99","observation_id":"2f8aa9a3-8b8e-4f56-a02f-6fcddb605a64","resolution":{"observed_at":"2026-08-15T23:14:57.902565Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04088","last_updated":"2024-01-08T18:47:34Z","snapshot_observed_at":"2026-08-13T19:43:49.936776Z","submitted_at":"2024-01-08T18:47:34Z","title":"Mixtral of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04088","snapshot_observed_at":"2026-08-15T23:14:57.670465Z","title":"Q., Sablayrolles, A., Roux, A., Mensch, A., Savary, B., Bamford, C., Chaplot, D","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.05335","last_updated":"2025-06-08T18:21:26Z","snapshot_observed_at":"2026-08-21T12:51:56.879148Z","submitted_at":"2025-05-08T15:27:43Z","title":"FLAM: Frame-Wise Language-Audio Modeling","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T23:14:57.670465Z"},"links":{"cited_paper":"/paper/2401.04088","citing_paper":"/paper/2505.05335"},"observation_digest":"sha256:a354cd8142f8adce90e7f3f4184598bc112b838a0d3e0c52d06d1b75738baabf","observation_id":"dc47e202-dfa9-4f5a-b9c3-80092f6f0dd9","resolution":{"observed_at":"2026-08-15T23:14:57.670465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:14:57.674591Z","title":"D., Kim, B., Lee, H., and Kim, G","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.05335","last_updated":"2025-06-08T18:21:26Z","snapshot_observed_at":"2026-08-21T12:51:56.879148Z","submitted_at":"2025-05-08T15:27:43Z","title":"FLAM: Frame-Wise Language-Audio Modeling","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T23:14:57.674591Z"},"links":{"citing_paper":"/paper/2505.05335"},"observation_digest":"sha256:7b9a222b962a2988404eafda6a2bc6708cd72034d0ba92dac82d6b56d32764af","observation_id":"b80bfbc1-7662-42ea-b0ca-ea5e83ff1bab","resolution":{"observed_at":"2026-08-15T23:14:57.674591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.11692","last_updated":"2019-07-26T17:48:29Z","snapshot_observed_at":"2026-08-16T14:33:50.657682Z","submitted_at":"2019-07-26T17:48:29Z","title":"RoBERTa: A Robustly Optimized BERT Pretraining Approach","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.11692","snapshot_observed_at":"2026-08-15T23:14:57.677909Z","title":"Avoiding spurious correlations via logit correction","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2505.05335","last_updated":"2025-06-08T18:21:26Z","snapshot_observed_at":"2026-08-21T12:51:56.879148Z","submitted_at":"2025-05-08T15:27:43Z","title":"FLAM: Frame-Wise Language-Audio Modeling","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T23:14:57.677909Z"},"links":{"cited_paper":"/paper/1907.11692","citing_paper":"/paper/2505.05335"},"observation_digest":"sha256:c2698703d216a2b1a8e53e3676146f7d6aeb00a8cb156c74de0a3772101a72b4","observation_id":"e68316b9-b23e-4c42-b5ba-7ba129a8b19d","resolution":{"observed_at":"2026-08-15T23:14:57.677909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-08-15T12:50:58.405488Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-15T23:14:57.681336Z","title":"Hierarchical text-conditional image generation with clip latents.arXiv preprint arXiv:2204.06125, 1(2):3,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.05335","last_updated":"2025-06-08T18:21:26Z","snapshot_observed_at":"2026-08-21T12:51:56.879148Z","submitted_at":"2025-05-08T15:27:43Z","title":"FLAM: Frame-Wise Language-Audio Modeling","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T23:14:57.681336Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2505.05335"},"observation_digest":"sha256:33f4014746508cd05e55050e13aacd7b3a93c1eed43ca4dfd7c8ff313c011f72","observation_id":"4db5f27a-8455-499a-a68d-67a314c8fd55","resolution":{"observed_at":"2026-08-15T23:14:57.681336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:14:57.867625Z","title":"Sound event detection in synthetic domestic environments","venue":null,"work_id":"712b9612-41a3-45c9-b2f2-dd55d2e8bc1c","year":2020},"citing_paper":{"arxiv_id":"2505.05335","last_updated":"2025-06-08T18:21:26Z","snapshot_observed_at":"2026-08-21T12:51:56.879148Z","submitted_at":"2025-05-08T15:27:43Z","title":"FLAM: Frame-Wise Language-Audio Modeling","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T23:14:57.685805Z"},"links":{"citing_paper":"/paper/2505.05335"},"observation_digest":"sha256:7a85068b284cd45c30dd1ea5137139a6f3fbdc587c60bc8f9075eca28b4b414c","observation_id":"81bd6d2f-1260-43bc-aad7-f341b9e331be","resolution":{"observed_at":"2026-08-15T23:14:57.871860Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:14:57.692841Z","title":"P., and Salamon, J","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.05335","last_updated":"2025-06-08T18:21:26Z","snapshot_observed_at":"2026-08-21T12:51:56.879148Z","submitted_at":"2025-05-08T15:27:43Z","title":"FLAM: Frame-Wise Language-Audio Modeling","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T23:14:57.692841Z"},"links":{"citing_paper":"/paper/2505.05335"},"observation_digest":"sha256:f144675f81f8ea16dfad31836e1dfe2924742b68781ebe0f51f844b85a2f4272","observation_id":"9a847350-0a3b-47f8-a3f7-77897add420e","resolution":{"observed_at":"2026-08-15T23:14:57.692841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:14:57.848718Z","title":"Large-scale contrastive language- audio pretraining with feature fusion and keyword-to- caption augmentation","venue":null,"work_id":"a893336a-0e76-4e3a-be98-9be8015479b4","year":2023},"citing_paper":{"arxiv_id":"2505.05335","last_updated":"2025-06-08T18:21:26Z","snapshot_observed_at":"2026-08-21T12:51:56.879148Z","submitted_at":"2025-05-08T15:27:43Z","title":"FLAM: Frame-Wise Language-Audio Modeling","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T23:14:57.697076Z"},"links":{"citing_paper":"/paper/2505.05335"},"observation_digest":"sha256:768c1b9cd8ad9d812ff339b247dac17a56ce5f923b02f22be2f9892e84cd3fac","observation_id":"12f7623d-c9a0-4803-b172-a3bc76e3cf64","resolution":{"observed_at":"2026-08-15T23:14:57.853356Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02584","last_updated":"2024-07-17T06:11:43Z","snapshot_observed_at":"2026-08-21T12:51:48.943019Z","submitted_at":"2024-01-05T00:27:32Z","title":"Towards Weakly Supervised Text-to-Audio Grounding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02584","snapshot_observed_at":"2026-08-15T23:14:57.700621Z","title":"Towards weakly supervised text-to-audio grounding.arXiv preprint arXiv:2401.02584,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.05335","last_updated":"2025-06-08T18:21:26Z","snapshot_observed_at":"2026-08-21T12:51:56.879148Z","submitted_at":"2025-05-08T15:27:43Z","title":"FLAM: Frame-Wise Language-Audio Modeling","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T23:14:57.700621Z"},"links":{"cited_paper":"/paper/2401.02584","citing_paper":"/paper/2505.05335"},"observation_digest":"sha256:c03b6d526548da1402a2411acbf12912bd06f33313b7c2e44b0814929b2b3612","observation_id":"732d6036-e9da-45dc-aad2-a9ff31ac24fd","resolution":{"observed_at":"2026-08-15T23:14:57.700621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.17806","last_updated":"2024-04-27T07:05:48Z","snapshot_observed_at":"2026-08-20T02:24:24.982715Z","submitted_at":"2024-04-27T07:05:48Z","title":"T-CLAP: Temporal-Enhanced Contrastive Language-Audio Pretraining","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.17806","snapshot_observed_at":"2026-08-15T23:14:57.704987Z","title":"D., and Wang, W","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.05335","last_updated":"2025-06-08T18:21:26Z","snapshot_observed_at":"2026-08-21T12:51:56.879148Z","submitted_at":"2025-05-08T15:27:43Z","title":"FLAM: Frame-Wise Language-Audio Modeling","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T23:14:57.704987Z"},"links":{"cited_paper":"/paper/2404.17806","citing_paper":"/paper/2505.05335"},"observation_digest":"sha256:0a5e8a78aff413c85e91d0b5d210a2fe616325d1ac84b63eee22f0ca6942a721","observation_id":"80215732-3d7b-4d1e-b4dd-04592a0a027c","resolution":{"observed_at":"2026-08-15T23:14:57.704987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:14:57.823893Z","title":null,"venue":null,"work_id":"5c212f9c-15b2-418b-8858-3769a2f8769a","year":2023},"citing_paper":{"arxiv_id":"2505.05335","last_updated":"2025-06-08T18:21:26Z","snapshot_observed_at":"2026-08-21T12:51:56.879148Z","submitted_at":"2025-05-08T15:27:43Z","title":"FLAM: Frame-Wise Language-Audio Modeling","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T23:14:57.714512Z"},"links":{"citing_paper":"/paper/2505.05335"},"observation_digest":"sha256:7f43f0a1f13697208e837afc3d37e4b2f9d3138f1bbf87415086e873720a55ef","observation_id":"c7354fde-6d19-4af0-828f-a21dbcc5c5b4","resolution":{"observed_at":"2026-08-15T23:14:57.828514Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:14:57.927078Z","title":"Clotho: An audio 9 FLAM: Frame-Wise Language-Audio Modeling captioning dataset","venue":null,"work_id":"0ab6e768-25ad-4cc2-9d2c-047e0cd86bd1","year":2020},"citing_paper":{"arxiv_id":"2505.05335","last_updated":"2025-06-08T18:21:26Z","snapshot_observed_at":"2026-08-21T12:51:56.879148Z","submitted_at":"2025-05-08T15:27:43Z","title":"FLAM: Frame-Wise Language-Audio Modeling","version":2},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-15T23:14:57.651200Z"},"links":{"citing_paper":"/paper/2505.05335"},"observation_digest":"sha256:99f9bd15e5b8cc0e5b47cbbd700ed1e8849522a3827d8f892ed2ea74a280d64e","observation_id":"79de48b6-c08d-4bde-a116-e7b818a4ac28","resolution":{"observed_at":"2026-08-15T23:14:57.931363Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:14:57.886346Z","title":"Mean teacher convolution system for dcase 2018 task","venue":null,"work_id":"0af06937-21f0-4007-9838-fb2775516708","year":2018},"citing_paper":{"arxiv_id":"2505.05335","last_updated":"2025-06-08T18:21:26Z","snapshot_observed_at":"2026-08-21T12:51:56.879148Z","submitted_at":"2025-05-08T15:27:43Z","title":"FLAM: Frame-Wise Language-Audio Modeling","version":2},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-15T23:14:57.667433Z"},"links":{"citing_paper":"/paper/2505.05335"},"observation_digest":"sha256:7eff018306c3b3d7adcac0570eec3e481a8460b793ec316d3977198a6fd014e9","observation_id":"13c7ae50-4fd3-4ded-87a9-f763dcb78a89","resolution":{"observed_at":"2026-08-15T23:14:57.890929Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:14:57.916310Z","title":"Threshold independent evaluation of sound event detection scores","venue":null,"work_id":"b7ae55cd-2c2f-4a6d-a342-116a726fa8b0","year":2022},"citing_paper":{"arxiv_id":"2505.05335","last_updated":"2025-06-08T18:21:26Z","snapshot_observed_at":"2026-08-21T12:51:56.879148Z","submitted_at":"2025-05-08T15:27:43Z","title":"FLAM: Frame-Wise Language-Audio Modeling","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-15T23:14:57.656329Z"},"links":{"citing_paper":"/paper/2505.05335"},"observation_digest":"sha256:e6d0cb17e0e981f1b9077fe2b1a02633603089b9ac94109eecdf422ff50c7925","observation_id":"606fde2d-a84f-49f3-8823-1c3621ec4a6c","resolution":{"observed_at":"2026-08-15T23:14:57.920000Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:14:57.939080Z","title":"Hts-at: A hierarchical token-semantic audio transformer for sound classification and detection","venue":null,"work_id":"82e3efbc-b27c-4f4b-8670-68aac701dd66","year":2022},"citing_paper":{"arxiv_id":"2505.05335","last_updated":"2025-06-08T18:21:26Z","snapshot_observed_at":"2026-08-21T12:51:56.879148Z","submitted_at":"2025-05-08T15:27:43Z","title":"FLAM: Frame-Wise Language-Audio Modeling","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-15T23:14:57.638635Z"},"links":{"citing_paper":"/paper/2505.05335"},"observation_digest":"sha256:de40505cf2ba203ac0395b16790f0806fd7a7e5b8a52d9eac2dee9d8c2cc79c7","observation_id":"998f6195-1d0b-4116-9d24-ae86f8738651","resolution":{"observed_at":"2026-08-15T23:14:57.943055Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08056","last_updated":"2024-06-12T10:12:53Z","snapshot_observed_at":"2026-08-21T12:53:19.566937Z","submitted_at":"2024-06-12T10:12:53Z","title":"DCASE 2024 Task 4: Sound Event Detection with Heterogeneous Data and Missing Labels","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08056","snapshot_observed_at":"2026-08-15T23:14:57.642924Z","title":"Dcase 2024 task 4: Sound event detection with heterogeneous data and missing labels.arXiv preprint arXiv:2406.08056,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.05335","last_updated":"2025-06-08T18:21:26Z","snapshot_observed_at":"2026-08-21T12:51:56.879148Z","submitted_at":"2025-05-08T15:27:43Z","title":"FLAM: Frame-Wise Language-Audio Modeling","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-15T23:14:57.642924Z"},"links":{"cited_paper":"/paper/2406.08056","citing_paper":"/paper/2505.05335"},"observation_digest":"sha256:0ac4f7769672fce567c7ae16a7f26978425a3d7ea531417efe37d077b43c08e2","observation_id":"78374fd8-036b-4c55-bc37-08dacc6bbb98","resolution":{"observed_at":"2026-08-15T23:14:57.642924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-08-14T18:53:38.574749Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-08-15T23:14:57.689004Z","title":"Representa- tion learning with contrastive predictive coding.ArXiv, abs/1807.03748,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.05335","last_updated":"2025-06-08T18:21:26Z","snapshot_observed_at":"2026-08-21T12:51:56.879148Z","submitted_at":"2025-05-08T15:27:43Z","title":"FLAM: Frame-Wise Language-Audio Modeling","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-15T23:14:57.689004Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2505.05335"},"observation_digest":"sha256:87ed72afc821695de384e95d464ed9a44832a4c16955da6dfa13b640a1411c3b","observation_id":"c97f3cde-cbda-41f2-8853-7725e4642df8","resolution":{"observed_at":"2026-08-15T23:14:57.689004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-08-14T18:16:28.847993Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-15T23:14:57.647008Z","title":"Bert: Pre-training of deep bidirectional trans- formers for language understanding.arXiv preprint arXiv:1810.04805,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.05335","last_updated":"2025-06-08T18:21:26Z","snapshot_observed_at":"2026-08-21T12:51:56.879148Z","submitted_at":"2025-05-08T15:27:43Z","title":"FLAM: Frame-Wise Language-Audio Modeling","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-15T23:14:57.647008Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2505.05335"},"observation_digest":"sha256:e8fbc6ca7e5a142add6e23ed8085c89430ce6e5982824c014b8497f7cde8f1f7","observation_id":"0f0b86cf-312a-40b0-8da0-d88b1a84335d","resolution":{"observed_at":"2026-08-15T23:14:57.647008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.05335","last_updated":"2025-06-08T18:21:26Z","latest_version":2,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-21T12:51:56.879148Z","submitted_at":"2025-05-08T15:27:43Z","title":"FLAM: Frame-Wise Language-Audio Modeling"},"reference_resolution":{"displayed":20,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":12,"verified_exact":0,"verified_fuzzy":8},"total_outbound_references":20},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 20 of 20 outbound references and 2 inbound Pith citation observations for arXiv:2505.05335."}