{"as_of":"2026-08-20T21:59:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:331923507e83e6dba51dc3df0af29aa7299c3c0e57f4e8d6c91f9500098743ce","coverage":[{"denominator":48,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":48,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:54:26.533962Z","state":"measured"},{"denominator":52,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":52,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T15:41:34.152062Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T07:39:38.511905Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.01111","last_updated":"2025-06-01T18:29:17Z","snapshot_observed_at":"2026-08-17T21:37:37.030375Z","submitted_at":"2025-06-01T18:29:17Z","title":"FusionAudio-1.2M: Towards Fine-grained Audio Captioning with Multimodal Contextual Fusion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.01111","snapshot_observed_at":"2026-08-03T21:06:08.068024Z","title":"Fusionaudio-1.2 m: Towards fine-grained audio captioning with multimodal contextual fusion.arXiv preprint arXiv:2506.01111,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.16757","last_updated":"2026-06-29T23:59:45Z","snapshot_observed_at":"2026-08-16T14:57:20.088308Z","submitted_at":"2025-11-20T19:17:35Z","title":"Revisiting Audio-language Pretraining for Learning General-purpose Audio Representation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T21:06:08.068024Z"},"links":{"cited_paper":"/paper/2506.01111","citing_paper":"/paper/2511.16757"},"observation_digest":"sha256:aeecc4d86d156e87c738cc773f94248667e8b3f295c3f54581cfb6c952154a8c","observation_id":"2dca371f-5f41-4521-8e81-5b79e200dd2f","resolution":{"observed_at":"2026-08-03T21:06:08.068024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01111","last_updated":"2025-06-01T18:29:17Z","snapshot_observed_at":"2026-08-17T21:37:37.030375Z","submitted_at":"2025-06-01T18:29:17Z","title":"FusionAudio-1.2M: Towards Fine-grained Audio Captioning with Multimodal Contextual Fusion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.01111","snapshot_observed_at":"2026-07-13T16:50:28.996341Z","title":"arXiv preprint arXiv:2506.01111","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.27667","last_updated":"2026-05-28T11:00:35Z","snapshot_observed_at":"2026-08-14T10:45:07.633606Z","submitted_at":"2026-03-29T12:32:04Z","title":"EvA: An Evidence-First Audio Understanding Paradigm for LALMs","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-13T16:50:28.996341Z"},"links":{"cited_paper":"/paper/2506.01111","citing_paper":"/paper/2603.27667"},"observation_digest":"sha256:96af2c6e08115423de400ea2284b79953a4f01a9d4bf882925399ee5840ad962","observation_id":"27bde799-b3b5-4866-86e4-ecf1e2a11ab2","resolution":{"observed_at":"2026-07-13T16:50:28.996341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01111","last_updated":"2025-06-01T18:29:17Z","snapshot_observed_at":"2026-08-17T21:37:37.030375Z","submitted_at":"2025-06-01T18:29:17Z","title":"FusionAudio-1.2M: Towards Fine-grained Audio Captioning with Multimodal Contextual Fusion","version":1},"cited_work":{"arxiv_id":"2506.01111","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.01111","snapshot_observed_at":"2026-07-04T07:39:38.511905Z","title":"Fusionaudio-1.2 m: Towards fine-grained audio captioning with multimodal contextual fusion,","venue":null,"work_id":"473fc3a6-113b-4d65-834d-c162f8a888aa","year":2025},"citing_paper":{"arxiv_id":"2606.21227","last_updated":"2026-06-19T08:47:05Z","snapshot_observed_at":"2026-08-05T17:22:44.002469Z","submitted_at":"2026-06-19T08:47:05Z","title":"Bagpiper-Edit: Zero-Shot Open-Ended Audio Editing via Rich-Caption","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-26T13:17:40.718000Z"},"links":{"cited_paper":"/paper/2506.01111","citing_paper":"/paper/2606.21227"},"observation_digest":"sha256:01ef2f2b1079d2e33ded9ea0921e20107b76c2adb5803f1b3db4e96621d952ca","observation_id":"1e3d27f5-dfab-44d1-80d7-b2c6cfffbafe","resolution":{"observed_at":"2026-07-04T07:39:38.513487Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01111","last_updated":"2025-06-01T18:29:17Z","snapshot_observed_at":"2026-08-17T21:37:37.030375Z","submitted_at":"2025-06-01T18:29:17Z","title":"FusionAudio-1.2M: Towards Fine-grained Audio Captioning with Multimodal Contextual Fusion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.01111","snapshot_observed_at":"2026-08-11T15:41:34.152062Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09529","last_updated":"2026-08-10T12:31:16Z","snapshot_observed_at":"2026-08-19T06:46:05.273713Z","submitted_at":"2026-08-10T12:31:16Z","title":"Towards Expressive and Faithful Audio-to-Image Generation: A Unified Multimodal Dataset and Synthesis Framework","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T15:41:34.152062Z"},"links":{"cited_paper":"/paper/2506.01111","citing_paper":"/paper/2608.09529"},"observation_digest":"sha256:af241160137d6e53353ff5c55c0ab4522f4c32ac4f4f808ba120a6b93adbe2ae","observation_id":"81f7bfc2-eef1-4023-80a4-976ee2762f86","resolution":{"observed_at":"2026-08-11T15:41:34.152062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.01111/citation-record","integrity":"/paper/2506.01111/integrity","json":"/paper/2506.01111/citation-record.json","paper":"/paper/2506.01111"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:54:21.897043Z","title":"Large-scale contrastive language-audio pretraining with feature fusion and keyword- to-caption augmentation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01111","last_updated":"2025-06-01T18:29:17Z","snapshot_observed_at":"2026-08-17T21:37:37.030375Z","submitted_at":"2025-06-01T18:29:17Z","title":"FusionAudio-1.2M: Towards Fine-grained Audio Captioning with Multimodal Contextual Fusion","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T11:54:21.897043Z"},"links":{"citing_paper":"/paper/2506.01111"},"observation_digest":"sha256:ba056091455845572b06e6f218d38c6ba832d1b59438f92c4b1dcf8173441e64","observation_id":"cc370d3f-ef9f-49e8-87e9-f98a4d298af9","resolution":{"observed_at":"2026-08-07T11:54:21.897043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:54:33.787711Z","title":"GAMA: A large audio-language model with advanced audio understanding and complex reasoning abilities","venue":null,"work_id":"a322ccad-f80a-424d-b8bd-483dc3f7bd66","year":2024},"citing_paper":{"arxiv_id":"2506.01111","last_updated":"2025-06-01T18:29:17Z","snapshot_observed_at":"2026-08-17T21:37:37.030375Z","submitted_at":"2025-06-01T18:29:17Z","title":"FusionAudio-1.2M: Towards Fine-grained Audio Captioning with Multimodal Contextual Fusion","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T11:54:21.982508Z"},"links":{"citing_paper":"/paper/2506.01111"},"observation_digest":"sha256:8b984c1fe2ad0e19c2fbbc60f65349d9add4f7fc71d035989ad5300febcf3b6f","observation_id":"38d7254e-d4ca-4bdf-80a0-79f7f82527d3","resolution":{"observed_at":"2026-08-07T11:54:33.855577Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10759","last_updated":"2024-07-15T14:38:09Z","snapshot_observed_at":"2026-08-14T01:27:16.843576Z","submitted_at":"2024-07-15T14:38:09Z","title":"Qwen2-Audio Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10759","snapshot_observed_at":"2026-08-07T11:54:22.155841Z","title":"Qwen2-audio technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01111","last_updated":"2025-06-01T18:29:17Z","snapshot_observed_at":"2026-08-17T21:37:37.030375Z","submitted_at":"2025-06-01T18:29:17Z","title":"FusionAudio-1.2M: Towards Fine-grained Audio Captioning with Multimodal Contextual Fusion","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T11:54:22.155841Z"},"links":{"cited_paper":"/paper/2407.10759","citing_paper":"/paper/2506.01111"},"observation_digest":"sha256:6fee79ba07ef8fe65a452efbd7a3170586dc1e5c39304f5f0613d161131bd239","observation_id":"d820f451-eaf9-45fe-9417-c12eb40bc215","resolution":{"observed_at":"2026-08-07T11:54:22.155841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:54:33.579561Z","title":"Clotho: An audio captioning dataset, 2019","venue":null,"work_id":"6a5fa001-0a46-4011-986b-99640bc6bb23","year":2019},"citing_paper":{"arxiv_id":"2506.01111","last_updated":"2025-06-01T18:29:17Z","snapshot_observed_at":"2026-08-17T21:37:37.030375Z","submitted_at":"2025-06-01T18:29:17Z","title":"FusionAudio-1.2M: Towards Fine-grained Audio Captioning with Multimodal Contextual Fusion","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T11:54:22.269803Z"},"links":{"citing_paper":"/paper/2506.01111"},"observation_digest":"sha256:6a108ff3fc00dfc9477c112ff730fd3bb0504aaf812d1c45f77917bb76ca8f92","observation_id":"b78b85a1-16ac-4e6c-a2d5-bd3926cfae93","resolution":{"observed_at":"2026-08-07T11:54:33.667717Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:54:33.359802Z","title":"AudioCaps: Gen- erating captions for audios in the wild","venue":null,"work_id":"b7675012-9162-4245-9b02-63b58d4bbe32","year":2019},"citing_paper":{"arxiv_id":"2506.01111","last_updated":"2025-06-01T18:29:17Z","snapshot_observed_at":"2026-08-17T21:37:37.030375Z","submitted_at":"2025-06-01T18:29:17Z","title":"FusionAudio-1.2M: Towards Fine-grained Audio Captioning with Multimodal Contextual Fusion","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T11:54:22.389758Z"},"links":{"citing_paper":"/paper/2506.01111"},"observation_digest":"sha256:7a8374e226273b8fd61a8764cf03ed7974e8e2b1d423b520915ea908830ac876","observation_id":"5eecb123-44b0-4203-b7d2-969117562a76","resolution":{"observed_at":"2026-08-07T11:54:33.459637Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:54:33.156653Z","title":"Laion-audio-630k dataset, 2023","venue":null,"work_id":"3bad4eca-c8d8-4652-b649-cde13a15acce","year":2023},"citing_paper":{"arxiv_id":"2506.01111","last_updated":"2025-06-01T18:29:17Z","snapshot_observed_at":"2026-08-17T21:37:37.030375Z","submitted_at":"2025-06-01T18:29:17Z","title":"FusionAudio-1.2M: Towards Fine-grained Audio Captioning with Multimodal Contextual Fusion","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T11:54:22.579658Z"},"links":{"citing_paper":"/paper/2506.01111"},"observation_digest":"sha256:de8f1e1c64b8fb899f74e833434ad856133bcc158fb84c87b3f36d04f1b59482","observation_id":"b35f10ac-e745-4208-a2a2-9fcf797c9f94","resolution":{"observed_at":"2026-08-07T11:54:33.252807Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:54:22.732392Z","title":"Plumbley, Yuexian Zou, and Wenwu Wang","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01111","last_updated":"2025-06-01T18:29:17Z","snapshot_observed_at":"2026-08-17T21:37:37.030375Z","submitted_at":"2025-06-01T18:29:17Z","title":"FusionAudio-1.2M: Towards Fine-grained Audio Captioning with Multimodal Contextual Fusion","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T11:54:22.732392Z"},"links":{"citing_paper":"/paper/2506.01111"},"observation_digest":"sha256:6cb789f2d581cd45bfee2cd10de58c6726c93f34159045e7700fb74d586c4325","observation_id":"2451f32d-b313-47aa-b839-3bddeac183c0","resolution":{"observed_at":"2026-08-07T11:54:22.732392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:54:32.967364Z","title":"Plumbley, Woon- Seng Gan, and Jianfeng Chen","venue":null,"work_id":"00f6cb01-691f-4df1-8af4-262cfe46bd73","year":2024},"citing_paper":{"arxiv_id":"2506.01111","last_updated":"2025-06-01T18:29:17Z","snapshot_observed_at":"2026-08-17T21:37:37.030375Z","submitted_at":"2025-06-01T18:29:17Z","title":"FusionAudio-1.2M: Towards Fine-grained Audio Captioning with Multimodal Contextual Fusion","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T11:54:22.838399Z"},"links":{"citing_paper":"/paper/2506.01111"},"observation_digest":"sha256:79fe09b417d9572fcdae3f2344d601018c7c9a7642fe0b5cf1113f06c2792c5c","observation_id":"5a50eb9d-dd42-4b28-b624-f47d9fb5e24e","resolution":{"observed_at":"2026-08-07T11:54:33.064023Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:54:32.730287Z","title":"Auto-acd: A large-scale dataset for audio-language representation learning, 2024","venue":null,"work_id":"f11264ef-7a8c-45c4-b031-be16323d7592","year":2024},"citing_paper":{"arxiv_id":"2506.01111","last_updated":"2025-06-01T18:29:17Z","snapshot_observed_at":"2026-08-17T21:37:37.030375Z","submitted_at":"2025-06-01T18:29:17Z","title":"FusionAudio-1.2M: Towards Fine-grained Audio Captioning with Multimodal Contextual Fusion","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T11:54:22.937909Z"},"links":{"citing_paper":"/paper/2506.01111"},"observation_digest":"sha256:324b8e068101096c5b1c849b0eea536f6f4a704f14d85d389bbecf80b52dcd36","observation_id":"fc93b794-3e01-472c-876e-f7598d659ac8","resolution":{"observed_at":"2026-08-07T11:54:32.823625Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:54:32.513009Z","title":"Plumbley, and Wenwu Wang","venue":null,"work_id":"6da7868e-9e51-4d5c-a239-fa6ecf4a1670","year":2025},"citing_paper":{"arxiv_id":"2506.01111","last_updated":"2025-06-01T18:29:17Z","snapshot_observed_at":"2026-08-17T21:37:37.030375Z","submitted_at":"2025-06-01T18:29:17Z","title":"FusionAudio-1.2M: Towards Fine-grained Audio Captioning with Multimodal Contextual Fusion","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T11:54:23.016763Z"},"links":{"citing_paper":"/paper/2506.01111"},"observation_digest":"sha256:e82dcde8742ff540dd5cb2d5b04c5b0ec2b0006c4cf634ae9c4b2f88163de49e","observation_id":"6644e575-145e-4f33-a8c6-998eed237ab5","resolution":{"observed_at":"2026-08-07T11:54:32.603896Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:54:23.123758Z","title":"Air-bench: Benchmarking large audio-language models via generative comprehension, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01111","last_updated":"2025-06-01T18:29:17Z","snapshot_observed_at":"2026-08-17T21:37:37.030375Z","submitted_at":"2025-06-01T18:29:17Z","title":"FusionAudio-1.2M: Towards Fine-grained Audio Captioning with Multimodal Contextual Fusion","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T11:54:23.123758Z"},"links":{"citing_paper":"/paper/2506.01111"},"observation_digest":"sha256:9adb6ccccf5163efb82a25896b07f2e3aaa6862536f5568d63fd9f9d5a3b1dc2","observation_id":"2595efec-ca1b-4177-baf7-4db62f5eb713","resolution":{"observed_at":"2026-08-07T11:54:23.123758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:54:32.265272Z","title":null,"venue":null,"work_id":"8fee5416-307f-4fa3-8754-3f58fcb35cd3","year":1954},"citing_paper":{"arxiv_id":"2506.01111","last_updated":"2025-06-01T18:29:17Z","snapshot_observed_at":"2026-08-17T21:37:37.030375Z","submitted_at":"2025-06-01T18:29:17Z","title":"FusionAudio-1.2M: Towards Fine-grained Audio Captioning with Multimodal Contextual Fusion","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T11:54:23.284501Z"},"links":{"citing_paper":"/paper/2506.01111"},"observation_digest":"sha256:7250f3a51cc1584e6b73f855089f9de08dd51247dc758830fcaf6f6780f6faad","observation_id":"7526a4a6-4242-4a4a-92b1-275753e75560","resolution":{"observed_at":"2026-08-07T11:54:32.366303Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:54:32.043545Z","title":"Logothetis, and Stefano Panzeri","venue":null,"work_id":"57f213c8-7d93-4d65-b549-63e6c13206b5","year":2010},"citing_paper":{"arxiv_id":"2506.01111","last_updated":"2025-06-01T18:29:17Z","snapshot_observed_at":"2026-08-17T21:37:37.030375Z","submitted_at":"2025-06-01T18:29:17Z","title":"FusionAudio-1.2M: Towards Fine-grained Audio Captioning with Multimodal Contextual Fusion","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T11:54:23.369380Z"},"links":{"citing_paper":"/paper/2506.01111"},"observation_digest":"sha256:9adaa906448f2435b24a373dba1a13a5535fa3982993fdff986b5b14c780659d","observation_id":"623cae2a-1a2d-484e-bd27-603b159ac3dc","resolution":{"observed_at":"2026-08-07T11:54:32.130971Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:54:31.842392Z","title":"Ernst and Heinrich H","venue":null,"work_id":"a80979f5-3c28-4bec-adf2-1825944b658a","year":2004},"citing_paper":{"arxiv_id":"2506.01111","last_updated":"2025-06-01T18:29:17Z","snapshot_observed_at":"2026-08-17T21:37:37.030375Z","submitted_at":"2025-06-01T18:29:17Z","title":"FusionAudio-1.2M: Towards Fine-grained Audio Captioning with Multimodal Contextual Fusion","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T11:54:23.514952Z"},"links":{"citing_paper":"/paper/2506.01111"},"observation_digest":"sha256:eeec5209f30916d4930639e1fc92c4e6a2e8b643a693b1ee12cd627f4e106d4a","observation_id":"66fa02db-07a5-46a8-b7b0-df63937ee244","resolution":{"observed_at":"2026-08-07T11:54:31.933877Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:54:31.579992Z","title":"Bregman.Auditory scene analysis: The perceptual organization of sound","venue":null,"work_id":"5c7ea43c-2e9c-4783-a0bd-14b47eb0eea7","year":1990},"citing_paper":{"arxiv_id":"2506.01111","last_updated":"2025-06-01T18:29:17Z","snapshot_observed_at":"2026-08-17T21:37:37.030375Z","submitted_at":"2025-06-01T18:29:17Z","title":"FusionAudio-1.2M: Towards Fine-grained Audio Captioning with Multimodal Contextual Fusion","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T11:54:23.606715Z"},"links":{"citing_paper":"/paper/2506.01111"},"observation_digest":"sha256:7e2924e94ad3a8fca71a90d5353a374381fadc1035b9c873d7f7ba0bee4b1dae","observation_id":"f5478d8a-f51b-41a3-9ce4-9edf31aa7945","resolution":{"observed_at":"2026-08-07T11:54:31.717289Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:54:31.425000Z","title":null,"venue":null,"work_id":"0b0391b0-a282-4407-aef1-cd44dfed4458","year":2011},"citing_paper":{"arxiv_id":"2506.01111","last_updated":"2025-06-01T18:29:17Z","snapshot_observed_at":"2026-08-17T21:37:37.030375Z","submitted_at":"2025-06-01T18:29:17Z","title":"FusionAudio-1.2M: Towards Fine-grained Audio Captioning with Multimodal Contextual Fusion","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T11:54:23.696649Z"},"links":{"citing_paper":"/paper/2506.01111"},"observation_digest":"sha256:6bfc7aba59742f2cbc8ba0fe1e53fc51cdbcbb97b8a1b06357ef320d284aae8f","observation_id":"db545bcc-c8e5-44d6-b9d6-a62097f4f62a","resolution":{"observed_at":"2026-08-07T11:54:31.475796Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:54:23.791108Z","title":"Robust speech recognition via large-scale weak supervision, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.01111","last_updated":"2025-06-01T18:29:17Z","snapshot_observed_at":"2026-08-17T21:37:37.030375Z","submitted_at":"2025-06-01T18:29:17Z","title":"FusionAudio-1.2M: Towards Fine-grained Audio Captioning with Multimodal Contextual Fusion","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T11:54:23.791108Z"},"links":{"citing_paper":"/paper/2506.01111"},"observation_digest":"sha256:6b55a71bfee50f6745646db03adbc8e7b763405e249d0361f40d956618010461","observation_id":"fcc38876-3201-4953-8df3-a34d43f5d720","resolution":{"observed_at":"2026-08-07T11:54:23.791108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.15573","last_updated":"2024-11-27T05:43:19Z","snapshot_observed_at":"2026-08-18T12:41:13.575048Z","submitted_at":"2024-10-21T01:36:42Z","title":"OpenMU: Your Swiss Army Knife for Music Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.15573","snapshot_observed_at":"2026-08-07T11:54:23.874122Z","title":"Openmu: Your swiss army knife for music understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01111","last_updated":"2025-06-01T18:29:17Z","snapshot_observed_at":"2026-08-17T21:37:37.030375Z","submitted_at":"2025-06-01T18:29:17Z","title":"FusionAudio-1.2M: Towards Fine-grained Audio Captioning with Multimodal Contextual Fusion","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T11:54:23.874122Z"},"links":{"cited_paper":"/paper/2410.15573","citing_paper":"/paper/2506.01111"},"observation_digest":"sha256:3bc2f8f075cab1835690450fdf31b300fa3a327ebe3283e348e918d60270b924","observation_id":"1a7114b2-1ba5-47c6-a4ce-75b965456850","resolution":{"observed_at":"2026-08-07T11:54:23.874122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-14T04:17:22.593941Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-07T11:54:23.957188Z","title":"Qwen2.5-vl technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01111","last_updated":"2025-06-01T18:29:17Z","snapshot_observed_at":"2026-08-17T21:37:37.030375Z","submitted_at":"2025-06-01T18:29:17Z","title":"FusionAudio-1.2M: Towards Fine-grained Audio Captioning with Multimodal Contextual Fusion","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T11:54:23.957188Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2506.01111"},"observation_digest":"sha256:ccd301561907214242453639c75374acd161bd05904e8a3a9a6be9eb148e717a","observation_id":"c05f132e-b094-48e9-842c-ed8375b1003c","resolution":{"observed_at":"2026-08-07T11:54:23.957188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:54:24.010409Z","title":"Qwq-32b: Embracing the power of reinforcement learning, March 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01111","last_updated":"2025-06-01T18:29:17Z","snapshot_observed_at":"2026-08-17T21:37:37.030375Z","submitted_at":"2025-06-01T18:29:17Z","title":"FusionAudio-1.2M: Towards Fine-grained Audio Captioning with Multimodal Contextual Fusion","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T11:54:24.010409Z"},"links":{"citing_paper":"/paper/2506.01111"},"observation_digest":"sha256:cf4415ea85c21942011a76bf5cb8f9878b9bc6f54fc39c3fe15bc3f13c0c70b0","observation_id":"246d2c6d-8a8a-4502-adc1-9c8eb70c8476","resolution":{"observed_at":"2026-08-07T11:54:24.010409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:54:31.199596Z","title":"Elizalde, S","venue":null,"work_id":"07b20fbf-21a1-4ff0-ab36-7678eb5c1252","year":2023},"citing_paper":{"arxiv_id":"2506.01111","last_updated":"2025-06-01T18:29:17Z","snapshot_observed_at":"2026-08-17T21:37:37.030375Z","submitted_at":"2025-06-01T18:29:17Z","title":"FusionAudio-1.2M: Towards Fine-grained Audio Captioning with Multimodal Contextual Fusion","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T11:54:24.064260Z"},"links":{"citing_paper":"/paper/2506.01111"},"observation_digest":"sha256:42de91e9e441042d245ce105778bbc42337aa5681769ecaae030fb3a83d1672d","observation_id":"5b530e6b-57c4-448c-a732-c3f507502ff5","resolution":{"observed_at":"2026-08-07T11:54:31.317776Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.00181","last_updated":"2021-09-01T04:18:19Z","snapshot_observed_at":"2026-08-18T04:02:18.735630Z","submitted_at":"2021-09-01T04:18:19Z","title":"CTAL: Pre-training Cross-modal Transformer for Audio-and-Language Representations","version":1},"cited_work":{"arxiv_id":"2109.00181","doi":null,"metadata_source":"pith","pith_arxiv_id":"2109.00181","snapshot_observed_at":"2026-08-07T11:54:26.730197Z","title":"CTAL: Pre-training Cross-modal Transformer for Audio-and-Language Representations","venue":"cs.SD","work_id":"31f6bc4f-4bdc-4858-af38-3d3eb0ae28cc","year":2021},"citing_paper":{"arxiv_id":"2506.01111","last_updated":"2025-06-01T18:29:17Z","snapshot_observed_at":"2026-08-17T21:37:37.030375Z","submitted_at":"2025-06-01T18:29:17Z","title":"FusionAudio-1.2M: Towards Fine-grained Audio Captioning with Multimodal Contextual Fusion","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T11:54:24.139798Z"},"links":{"cited_paper":"/paper/2109.00181","citing_paper":"/paper/2506.01111"},"observation_digest":"sha256:f9919ab2acfbfc407f9814f3e08c63f8be710b290a6e26dc9d056ce29e2b2cad","observation_id":"96a26cd4-5438-442b-8501-83c7f5e3ccbf","resolution":{"observed_at":"2026-08-07T11:54:26.810143Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:54:30.996324Z","title":"Yeh, P.-Y","venue":null,"work_id":"28bed9ec-99e4-4d86-9c3f-aeac4876631f","year":2023},"citing_paper":{"arxiv_id":"2506.01111","last_updated":"2025-06-01T18:29:17Z","snapshot_observed_at":"2026-08-17T21:37:37.030375Z","submitted_at":"2025-06-01T18:29:17Z","title":"FusionAudio-1.2M: Towards Fine-grained Audio Captioning with Multimodal Contextual Fusion","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T11:54:24.192860Z"},"links":{"citing_paper":"/paper/2506.01111"},"observation_digest":"sha256:5133977af5b71332cf59a1a9c34acd8c58c16eaadf94c00f197ff409429edbd2","observation_id":"21d36ae2-4189-491f-a8d3-e1e5c3946cab","resolution":{"observed_at":"2026-08-07T11:54:31.096452Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00704","last_updated":"2024-12-10T03:17:56Z","snapshot_observed_at":"2026-08-16T14:56:06.586855Z","submitted_at":"2023-10-01T15:49:46Z","title":"UniAudio: An Audio Foundation Model Toward Universal Audio Generation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00704","snapshot_observed_at":"2026-08-07T11:54:24.284181Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01111","last_updated":"2025-06-01T18:29:17Z","snapshot_observed_at":"2026-08-17T21:37:37.030375Z","submitted_at":"2025-06-01T18:29:17Z","title":"FusionAudio-1.2M: Towards Fine-grained Audio Captioning with Multimodal Contextual Fusion","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T11:54:24.284181Z"},"links":{"cited_paper":"/paper/2310.00704","citing_paper":"/paper/2506.01111"},"observation_digest":"sha256:cdac68d8cde7a4bf819b42a194594ab3b1f335884074fe4184786275ff5acb80","observation_id":"93b38794-9dc5-4c3f-b4e9-219efef4dac9","resolution":{"observed_at":"2026-08-07T11:54:24.284181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:54:30.823394Z","title":null,"venue":null,"work_id":"ce0546fa-9be8-48af-9a0b-e0d032aa4f27","year":2024},"citing_paper":{"arxiv_id":"2506.01111","last_updated":"2025-06-01T18:29:17Z","snapshot_observed_at":"2026-08-17T21:37:37.030375Z","submitted_at":"2025-06-01T18:29:17Z","title":"FusionAudio-1.2M: Towards Fine-grained Audio Captioning with Multimodal Contextual Fusion","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T11:54:24.399481Z"},"links":{"citing_paper":"/paper/2506.01111"},"observation_digest":"sha256:457d1e6cb346a36e08782281ca913d12f2186ff8ac142e0ca557fa795d8fbb7f","observation_id":"934e5a04-3a41-46a3-a014-3186c6fd475d","resolution":{"observed_at":"2026-08-07T11:54:30.908490Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:54:30.644081Z","title":"Pengi: An audio language model for audio tasks","venue":null,"work_id":"46c1365e-ef74-4cd6-9cba-85aa35d97876","year":2023},"citing_paper":{"arxiv_id":"2506.01111","last_updated":"2025-06-01T18:29:17Z","snapshot_observed_at":"2026-08-17T21:37:37.030375Z","submitted_at":"2025-06-01T18:29:17Z","title":"FusionAudio-1.2M: Towards Fine-grained Audio Captioning with Multimodal Contextual Fusion","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T11:54:24.533014Z"},"links":{"citing_paper":"/paper/2506.01111"},"observation_digest":"sha256:d9b5311bf3af247dde0e737638e6bc983ce8363d114b56b906913a9f9b279e0c","observation_id":"8ee85056-7646-4160-aa5d-1a7aa678299e","resolution":{"observed_at":"2026-08-07T11:54:30.733035Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-08-07T10:17:55.688598Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-08-07T11:54:24.590613Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01111","last_updated":"2025-06-01T18:29:17Z","snapshot_observed_at":"2026-08-17T21:37:37.030375Z","submitted_at":"2025-06-01T18:29:17Z","title":"FusionAudio-1.2M: Towards Fine-grained Audio Captioning with Multimodal Contextual Fusion","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T11:54:24.590613Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2506.01111"},"observation_digest":"sha256:83ef94d170a5aaf3893fae0f248d31acbdc7e421e508cd16f8cdd0ea1a4a6b49","observation_id":"49ce8f76-5915-466e-9e36-442b9caf9ff3","resolution":{"observed_at":"2026-08-07T11:54:24.590613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01831","last_updated":"2024-05-28T05:44:53Z","snapshot_observed_at":"2026-08-16T14:22:01.900523Z","submitted_at":"2024-02-02T18:58:34Z","title":"Audio Flamingo: A Novel Audio Language Model with Few-Shot Learning and Dialogue Abilities","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01831","snapshot_observed_at":"2026-08-07T11:54:24.703966Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01111","last_updated":"2025-06-01T18:29:17Z","snapshot_observed_at":"2026-08-17T21:37:37.030375Z","submitted_at":"2025-06-01T18:29:17Z","title":"FusionAudio-1.2M: Towards Fine-grained Audio Captioning with Multimodal Contextual Fusion","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T11:54:24.703966Z"},"links":{"cited_paper":"/paper/2402.01831","citing_paper":"/paper/2506.01111"},"observation_digest":"sha256:82008f628e724d9c12cbb03f13993d1339f3ef9f054b04f82bd6f69951cf7cc7","observation_id":"ddf48656-4821-4cf4-a23e-f436705725c2","resolution":{"observed_at":"2026-08-07T11:54:24.703966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:54:30.421842Z","title":"Hybrid transformers for music source separation","venue":null,"work_id":"3f7eecda-3682-4327-85eb-f311800603b8","year":2023},"citing_paper":{"arxiv_id":"2506.01111","last_updated":"2025-06-01T18:29:17Z","snapshot_observed_at":"2026-08-17T21:37:37.030375Z","submitted_at":"2025-06-01T18:29:17Z","title":"FusionAudio-1.2M: Towards Fine-grained Audio Captioning with Multimodal Contextual Fusion","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T11:54:24.807745Z"},"links":{"citing_paper":"/paper/2506.01111"},"observation_digest":"sha256:e626c1104077a181732cb1e4e244276c1f393dd4f96abd16ab9b78511398da97","observation_id":"72eafdcd-927d-4425-8bee-60ce0ed98965","resolution":{"observed_at":"2026-08-07T11:54:30.538543Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:54:30.189264Z","title":"Yamnet: Audio event classification","venue":null,"work_id":"f18e52c6-ed67-48b6-a88e-e7bff030903c","year":2025},"citing_paper":{"arxiv_id":"2506.01111","last_updated":"2025-06-01T18:29:17Z","snapshot_observed_at":"2026-08-17T21:37:37.030375Z","submitted_at":"2025-06-01T18:29:17Z","title":"FusionAudio-1.2M: Towards Fine-grained Audio Captioning with Multimodal Contextual Fusion","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T11:54:24.919854Z"},"links":{"citing_paper":"/paper/2506.01111"},"observation_digest":"sha256:d2341b63c19a1025eb040a541b468ca8d5bb7f93ba2d2566f3605b7e540f8212","observation_id":"02d9edf9-e02d-4217-9fc5-4aff04ff41d0","resolution":{"observed_at":"2026-08-07T11:54:30.293154Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:54:29.964879Z","title":"Gemmeke, Daniel P","venue":null,"work_id":"902ccf19-2b70-4627-8af7-f7a35b20d729","year":2017},"citing_paper":{"arxiv_id":"2506.01111","last_updated":"2025-06-01T18:29:17Z","snapshot_observed_at":"2026-08-17T21:37:37.030375Z","submitted_at":"2025-06-01T18:29:17Z","title":"FusionAudio-1.2M: Towards Fine-grained Audio Captioning with Multimodal Contextual Fusion","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T11:54:25.029097Z"},"links":{"citing_paper":"/paper/2506.01111"},"observation_digest":"sha256:fef175fc64fadea12e15ac8869de394f023a71da51f3e9f909aef913ea172934","observation_id":"30d3e3b0-1c19-4c46-96f8-6d74b5b4b9b1","resolution":{"observed_at":"2026-08-07T11:54:30.078863Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:54:25.099327Z","title":"Visualizing data using t-sne.Journal of Machine Learning Research, 9(86):2579–2605, 2008","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2506.01111","last_updated":"2025-06-01T18:29:17Z","snapshot_observed_at":"2026-08-17T21:37:37.030375Z","submitted_at":"2025-06-01T18:29:17Z","title":"FusionAudio-1.2M: Towards Fine-grained Audio Captioning with Multimodal Contextual Fusion","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T11:54:25.099327Z"},"links":{"citing_paper":"/paper/2506.01111"},"observation_digest":"sha256:1de3dc16ab8c1f1aa68ff12df4700b740aef53c63f0cf14775e59ee17b0ec84e","observation_id":"c2a87ce3-ce16-4470-ab22-7d48c573fdd7","resolution":{"observed_at":"2026-08-07T11:54:25.099327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:54:29.747569Z","title":"Hts- at: A hierarchical token-semantic audio transformer for sound classification and detection","venue":null,"work_id":"81c273e8-c2c3-48ab-b5d2-d5d81b2aef64","year":2022},"citing_paper":{"arxiv_id":"2506.01111","last_updated":"2025-06-01T18:29:17Z","snapshot_observed_at":"2026-08-17T21:37:37.030375Z","submitted_at":"2025-06-01T18:29:17Z","title":"FusionAudio-1.2M: Towards Fine-grained Audio Captioning with Multimodal Contextual Fusion","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T11:54:25.166218Z"},"links":{"citing_paper":"/paper/2506.01111"},"observation_digest":"sha256:4908c49b42c75257231a45eff285691452dec9c0de248c0bbc0821577b52b556","observation_id":"1cdb47c3-095c-49ba-9dea-11f5b8c8a35a","resolution":{"observed_at":"2026-08-07T11:54:29.832360Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:54:29.493689Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding","venue":null,"work_id":"184fc44d-cd0d-48d6-b078-a5a9324688be","year":2019},"citing_paper":{"arxiv_id":"2506.01111","last_updated":"2025-06-01T18:29:17Z","snapshot_observed_at":"2026-08-17T21:37:37.030375Z","submitted_at":"2025-06-01T18:29:17Z","title":"FusionAudio-1.2M: Towards Fine-grained Audio Captioning with Multimodal Contextual Fusion","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T11:54:25.272799Z"},"links":{"citing_paper":"/paper/2506.01111"},"observation_digest":"sha256:d42c6cf6c0e223c82443d385c72755a2aeabb6ec569894bb96ba33b31d4eb93b","observation_id":"5a1aa497-cdd8-43e2-af63-140883b60f41","resolution":{"observed_at":"2026-08-07T11:54:29.622647Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:54:29.320339Z","title":"• If the intensity or emotional context of the sound is conveyed (e.g., the dog barking intensely or the doorbell ringing in a rapid succession)","venue":null,"work_id":"df8f7448-3077-40e2-8328-c0eb8ae75524","year":null},"citing_paper":{"arxiv_id":"2506.01111","last_updated":"2025-06-01T18:29:17Z","snapshot_observed_at":"2026-08-17T21:37:37.030375Z","submitted_at":"2025-06-01T18:29:17Z","title":"FusionAudio-1.2M: Towards Fine-grained Audio Captioning with Multimodal Contextual Fusion","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T11:54:25.370191Z"},"links":{"citing_paper":"/paper/2506.01111"},"observation_digest":"sha256:0cf0a6da18770190aa767dbae73f9022fa1b6af5501d6a383c3d09bd53e6d1bb","observation_id":"5f3d0f4a-b6a0-48ba-a7a0-2de3f300d16d","resolution":{"observed_at":"2026-08-07T11:54:29.400615Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:54:29.110268Z","title":"trumpets,","venue":null,"work_id":"85a09df7-2485-4a6f-b58f-98e1bef96d90","year":null},"citing_paper":{"arxiv_id":"2506.01111","last_updated":"2025-06-01T18:29:17Z","snapshot_observed_at":"2026-08-17T21:37:37.030375Z","submitted_at":"2025-06-01T18:29:17Z","title":"FusionAudio-1.2M: Towards Fine-grained Audio Captioning with Multimodal Contextual Fusion","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T11:54:25.449949Z"},"links":{"citing_paper":"/paper/2506.01111"},"observation_digest":"sha256:d85e4a877f6d22c453513b6e90109dd1a80cd446d042ed2c009bb7af79053c73","observation_id":"f76d6af2-fcf9-4a94-948d-b022ba748b5e","resolution":{"observed_at":"2026-08-07T11:54:29.201077Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:54:28.919837Z","title":null,"venue":null,"work_id":"9d7542fe-2fb3-407b-acab-9fb4d07e746d","year":null},"citing_paper":{"arxiv_id":"2506.01111","last_updated":"2025-06-01T18:29:17Z","snapshot_observed_at":"2026-08-17T21:37:37.030375Z","submitted_at":"2025-06-01T18:29:17Z","title":"FusionAudio-1.2M: Towards Fine-grained Audio Captioning with Multimodal Contextual Fusion","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T11:54:25.515475Z"},"links":{"citing_paper":"/paper/2506.01111"},"observation_digest":"sha256:f01ea5ce361ef0359ecb183d4523c252b3fedd7784dd50c9385b0a941bf2ca56","observation_id":"942d7622-30eb-4367-ad85-108b4391203d","resolution":{"observed_at":"2026-08-07T11:54:29.016598Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:54:28.737587Z","title":null,"venue":null,"work_id":"1780665b-a75c-4c69-bc67-489dfb0dfee8","year":null},"citing_paper":{"arxiv_id":"2506.01111","last_updated":"2025-06-01T18:29:17Z","snapshot_observed_at":"2026-08-17T21:37:37.030375Z","submitted_at":"2025-06-01T18:29:17Z","title":"FusionAudio-1.2M: Towards Fine-grained Audio Captioning with Multimodal Contextual Fusion","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T11:54:25.614622Z"},"links":{"citing_paper":"/paper/2506.01111"},"observation_digest":"sha256:02e201a9eaa5f231bfb5355a85a90871ddf496a3c72feaabb0b39b4334daa30a","observation_id":"887a1896-de18-4dae-81fe-055598b02891","resolution":{"observed_at":"2026-08-07T11:54:28.819671Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:54:28.557386Z","title":null,"venue":null,"work_id":"031a0b1d-087f-4ccb-ae9d-f3b46b08c431","year":null},"citing_paper":{"arxiv_id":"2506.01111","last_updated":"2025-06-01T18:29:17Z","snapshot_observed_at":"2026-08-17T21:37:37.030375Z","submitted_at":"2025-06-01T18:29:17Z","title":"FusionAudio-1.2M: Towards Fine-grained Audio Captioning with Multimodal Contextual Fusion","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T11:54:25.722899Z"},"links":{"citing_paper":"/paper/2506.01111"},"observation_digest":"sha256:ead3531408f417799a706d14f96580b962d58b6ccdbdc592986f5b3083d56c25","observation_id":"2f4dff6b-52f8-4c4b-be0b-301752e4994c","resolution":{"observed_at":"2026-08-07T11:54:28.618007Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:54:28.355378Z","title":null,"venue":null,"work_id":"62155554-7eb7-4ff1-9fbe-30f7046df20e","year":null},"citing_paper":{"arxiv_id":"2506.01111","last_updated":"2025-06-01T18:29:17Z","snapshot_observed_at":"2026-08-17T21:37:37.030375Z","submitted_at":"2025-06-01T18:29:17Z","title":"FusionAudio-1.2M: Towards Fine-grained Audio Captioning with Multimodal Contextual Fusion","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T11:54:25.834488Z"},"links":{"citing_paper":"/paper/2506.01111"},"observation_digest":"sha256:baeba279d9ca0ab23b3371670637b65d7c02c00d369db5fb4093e8738d656eaf","observation_id":"647bcb52-c431-4d05-bcc4-bf9144e0205b","resolution":{"observed_at":"2026-08-07T11:54:28.468326Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:54:28.159180Z","title":null,"venue":null,"work_id":"5162ca7d-f71f-4481-b272-73063f3c9e6f","year":null},"citing_paper":{"arxiv_id":"2506.01111","last_updated":"2025-06-01T18:29:17Z","snapshot_observed_at":"2026-08-17T21:37:37.030375Z","submitted_at":"2025-06-01T18:29:17Z","title":"FusionAudio-1.2M: Towards Fine-grained Audio Captioning with Multimodal Contextual Fusion","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T11:54:25.909754Z"},"links":{"citing_paper":"/paper/2506.01111"},"observation_digest":"sha256:92c05c1adb78dd5bc88d496399902cd4afc491b7eea8da0b4fc22cc7de7d2047","observation_id":"84987096-14f7-4a6a-93c5-df9dea7ea3c5","resolution":{"observed_at":"2026-08-07T11:54:28.257431Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:54:27.946271Z","title":null,"venue":null,"work_id":"f0dce4c8-9c14-43a5-8622-43be83af6dd6","year":null},"citing_paper":{"arxiv_id":"2506.01111","last_updated":"2025-06-01T18:29:17Z","snapshot_observed_at":"2026-08-17T21:37:37.030375Z","submitted_at":"2025-06-01T18:29:17Z","title":"FusionAudio-1.2M: Towards Fine-grained Audio Captioning with Multimodal Contextual Fusion","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T11:54:26.039626Z"},"links":{"citing_paper":"/paper/2506.01111"},"observation_digest":"sha256:3549b51536d422a8bed4b945074cbd15331684918f1ce85c53769df849df00f8","observation_id":"a2bcbc8d-1215-46ca-a725-a5dbb990fb6d","resolution":{"observed_at":"2026-08-07T11:54:28.031006Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:54:27.747200Z","title":"instrument","venue":null,"work_id":"809f1710-67a5-4b33-934e-af89aac52132","year":null},"citing_paper":{"arxiv_id":"2506.01111","last_updated":"2025-06-01T18:29:17Z","snapshot_observed_at":"2026-08-17T21:37:37.030375Z","submitted_at":"2025-06-01T18:29:17Z","title":"FusionAudio-1.2M: Towards Fine-grained Audio Captioning with Multimodal Contextual Fusion","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T11:54:26.116448Z"},"links":{"citing_paper":"/paper/2506.01111"},"observation_digest":"sha256:d102bd44ba621745a9465d7ba3444c531ae2747eddf2f58b6d00cfc26e11d067","observation_id":"7fe5bfa9-5d6a-423e-bd72-555cdececd27","resolution":{"observed_at":"2026-08-07T11:54:27.849529Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:54:27.549933Z","title":null,"venue":null,"work_id":"9cdec9f0-433a-452a-85c8-2172eec7f8f0","year":null},"citing_paper":{"arxiv_id":"2506.01111","last_updated":"2025-06-01T18:29:17Z","snapshot_observed_at":"2026-08-17T21:37:37.030375Z","submitted_at":"2025-06-01T18:29:17Z","title":"FusionAudio-1.2M: Towards Fine-grained Audio Captioning with Multimodal Contextual Fusion","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T11:54:26.220834Z"},"links":{"citing_paper":"/paper/2506.01111"},"observation_digest":"sha256:4b7005d34608045ea59e6410620c59e93e58a7eec74d6ba994ff0d6c6ce33ea5","observation_id":"ff0f6336-9620-4f16-b60c-9a53810b553d","resolution":{"observed_at":"2026-08-07T11:54:27.616673Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:54:27.346610Z","title":null,"venue":null,"work_id":"995ab71e-7030-4311-8454-0ce7d42da586","year":null},"citing_paper":{"arxiv_id":"2506.01111","last_updated":"2025-06-01T18:29:17Z","snapshot_observed_at":"2026-08-17T21:37:37.030375Z","submitted_at":"2025-06-01T18:29:17Z","title":"FusionAudio-1.2M: Towards Fine-grained Audio Captioning with Multimodal Contextual Fusion","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T11:54:26.317122Z"},"links":{"citing_paper":"/paper/2506.01111"},"observation_digest":"sha256:45d42d090aa2edade5589112a18d03498bd0f42b7bd9130de2fd3fdecf4c15da","observation_id":"98da82d0-c3fe-4687-b349-4a6ed02d6fe9","resolution":{"observed_at":"2026-08-07T11:54:27.452235Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:54:27.129521Z","title":"A car’s engine roars as it accelerates","venue":null,"work_id":"3ac0d711-45ed-42ff-a2a9-cb3fe9e1b2c6","year":null},"citing_paper":{"arxiv_id":"2506.01111","last_updated":"2025-06-01T18:29:17Z","snapshot_observed_at":"2026-08-17T21:37:37.030375Z","submitted_at":"2025-06-01T18:29:17Z","title":"FusionAudio-1.2M: Towards Fine-grained Audio Captioning with Multimodal Contextual Fusion","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T11:54:26.419983Z"},"links":{"citing_paper":"/paper/2506.01111"},"observation_digest":"sha256:60d9d73e09a3992dabb1a1b76fe1f8d598c8415cd0747fb9bfb383e5d0a96f10","observation_id":"b7ad94d4-13eb-415c-8f32-d6641bdda7f4","resolution":{"observed_at":"2026-08-07T11:54:27.249922Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:54:26.961454Z","title":"Audio Description","venue":null,"work_id":"06803ea0-c87d-4037-b56b-dee9fe2d0c6f","year":null},"citing_paper":{"arxiv_id":"2506.01111","last_updated":"2025-06-01T18:29:17Z","snapshot_observed_at":"2026-08-17T21:37:37.030375Z","submitted_at":"2025-06-01T18:29:17Z","title":"FusionAudio-1.2M: Towards Fine-grained Audio Captioning with Multimodal Contextual Fusion","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T11:54:26.533962Z"},"links":{"citing_paper":"/paper/2506.01111"},"observation_digest":"sha256:6a15e27f60c4741b4b36d94c28791816c94494f25ac4e6cfbaa4fddfaf3a2f14","observation_id":"fdc345c5-9d2c-405e-9690-b471e65f7f27","resolution":{"observed_at":"2026-08-07T11:54:27.030893Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:54:22.082802Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.01111","last_updated":"2025-06-01T18:29:17Z","snapshot_observed_at":"2026-08-17T21:37:37.030375Z","submitted_at":"2025-06-01T18:29:17Z","title":"FusionAudio-1.2M: Towards Fine-grained Audio Captioning with Multimodal Contextual Fusion","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T11:54:22.082802Z"},"links":{"citing_paper":"/paper/2506.01111"},"observation_digest":"sha256:fcc863ff788b0e53f48b5eea08157934aa99c720e151d00570d35463f8015bec","observation_id":"afbe7848-d998-486f-aed2-0171e0a7c2ae","resolution":{"observed_at":"2026-08-07T11:54:22.082802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.01111","last_updated":"2025-06-01T18:29:17Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-17T21:37:37.030375Z","submitted_at":"2025-06-01T18:29:17Z","title":"FusionAudio-1.2M: Towards Fine-grained Audio Captioning with Multimodal Contextual Fusion"},"reference_resolution":{"displayed":48,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":24,"verified_exact":1,"verified_fuzzy":23},"total_outbound_references":48},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 48 of 48 outbound references and 4 inbound Pith citation observations for arXiv:2506.01111."}