{"as_of":"2026-08-10T02:17:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a937e79571b1632d3f7ac7833a4d5f78972cb1ac5bca942076b5cdafaeda4b07","coverage":[{"denominator":24,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":24,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:07:23.830824Z","state":"measured"},{"denominator":24,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":24,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.19937/citation-record","integrity":"/paper/2505.19937/integrity","json":"/paper/2505.19937/citation-record.json","paper":"/paper/2505.19937"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T14:07:21.896626Z","title":"L., Almeida, D., Altenschmidt, J., Altman, S., Anadkat, S., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19937","last_updated":"2026-06-16T16:14:58Z","snapshot_observed_at":"2026-08-09T04:16:14.877460Z","submitted_at":"2025-05-26T13:02:44Z","title":"ALAS: An Automatic Latent Alignment Score for Audio Language Models","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:07:21.896626Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.19937"},"observation_digest":"sha256:beaa7792a0053c981b605be5188b46490473250f681b72f314f3c67300799599","observation_id":"117a7724-c508-4d03-8e14-3f0b0bd86268","resolution":{"observed_at":"2026-08-07T14:07:21.896626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:07:24.743907Z","title":"D., Dhariwal, P., Neelakantan, A., Shyam, P., Sastry, G., Askell, A., et al","venue":null,"work_id":"37f726b1-51db-4ba0-8e2f-94f9636dbe96","year":1901},"citing_paper":{"arxiv_id":"2505.19937","last_updated":"2026-06-16T16:14:58Z","snapshot_observed_at":"2026-08-09T04:16:14.877460Z","submitted_at":"2025-05-26T13:02:44Z","title":"ALAS: An Automatic Latent Alignment Score for Audio Language Models","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:07:22.050159Z"},"links":{"citing_paper":"/paper/2505.19937"},"observation_digest":"sha256:39171bef734824815224013fb217972583098142474eb0015ee993f95795e389","observation_id":"5f76d5ca-c8fc-4a70-b4bf-5d5efddd2488","resolution":{"observed_at":"2026-08-07T14:07:24.781925Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10759","last_updated":"2024-07-15T14:38:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T14:38:09Z","title":"Qwen2-Audio Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10759","snapshot_observed_at":"2026-08-07T14:07:22.240948Z","title":"Qwen2-audio technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19937","last_updated":"2026-06-16T16:14:58Z","snapshot_observed_at":"2026-08-09T04:16:14.877460Z","submitted_at":"2025-05-26T13:02:44Z","title":"ALAS: An Automatic Latent Alignment Score for Audio Language Models","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:07:22.240948Z"},"links":{"cited_paper":"/paper/2407.10759","citing_paper":"/paper/2505.19937"},"observation_digest":"sha256:6545f7f4e5e327dc3789d172787e17ba5c08e299455f1a42f854a4e4db8fc88d","observation_id":"da7506df-fcba-433e-8503-7e8253153d93","resolution":{"observed_at":"2026-08-07T14:07:22.240948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.10360","last_updated":"2022-03-17T11:49:55Z","snapshot_observed_at":"2026-07-06T10:51:12.871009Z","submitted_at":"2021-03-18T16:30:26Z","title":"GLM: General Language Model Pretraining with Autoregressive Blank Infilling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.10360","snapshot_observed_at":"2026-08-07T14:07:22.407437Z","title":"Glm: General language model pretrain- ing with autoregressive blank infilling","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19937","last_updated":"2026-06-16T16:14:58Z","snapshot_observed_at":"2026-08-09T04:16:14.877460Z","submitted_at":"2025-05-26T13:02:44Z","title":"ALAS: An Automatic Latent Alignment Score for Audio Language Models","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:07:22.407437Z"},"links":{"cited_paper":"/paper/2103.10360","citing_paper":"/paper/2505.19937"},"observation_digest":"sha256:38b479880918c4d3364aec02e755403ae8e8a7437206ff1c6ee1432ad663095c","observation_id":"f34a3591-95b3-4b10-9b4e-d2b3dbe235ee","resolution":{"observed_at":"2026-08-07T14:07:22.407437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10790","last_updated":"2024-02-19T23:51:49Z","snapshot_observed_at":"2026-08-06T15:52:37.531678Z","submitted_at":"2023-05-18T08:03:37Z","title":"Listen, Think, and Understand","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10790","snapshot_observed_at":"2026-08-07T14:07:22.512637Z","title":"H., Karlinsky, L., and Glass, J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19937","last_updated":"2026-06-16T16:14:58Z","snapshot_observed_at":"2026-08-09T04:16:14.877460Z","submitted_at":"2025-05-26T13:02:44Z","title":"ALAS: An Automatic Latent Alignment Score for Audio Language Models","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:07:22.512637Z"},"links":{"cited_paper":"/paper/2305.10790","citing_paper":"/paper/2505.19937"},"observation_digest":"sha256:448ca9a364354cdddbc3bb8429fcba85cf62ee0a37a573bc93c894d6a64b610b","observation_id":"4ee1ee6e-52f7-4975-adb3-778e897e1cef","resolution":{"observed_at":"2026-08-07T14:07:22.512637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:07:24.611635Z","title":"Less peaky and more accurate ctc forced alignment by label priors","venue":null,"work_id":"152e3870-51b0-4ad9-9664-3e33a8099491","year":2024},"citing_paper":{"arxiv_id":"2505.19937","last_updated":"2026-06-16T16:14:58Z","snapshot_observed_at":"2026-08-09T04:16:14.877460Z","submitted_at":"2025-05-26T13:02:44Z","title":"ALAS: An Automatic Latent Alignment Score for Audio Language Models","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:07:22.654319Z"},"links":{"citing_paper":"/paper/2505.19937"},"observation_digest":"sha256:ac28eebdea3448890d530cb67fc4f74fed57a346832b2f2b1853aa9c0b64c1e2","observation_id":"838fc321-f817-4d08-ae20-4c03750c6c18","resolution":{"observed_at":"2026-08-07T14:07:24.668628Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05425","last_updated":"2023-06-08T17:59:56Z","snapshot_observed_at":"2026-07-06T15:40:24.127663Z","submitted_at":"2023-06-08T17:59:56Z","title":"MIMIC-IT: Multi-Modal In-Context Instruction Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05425","snapshot_observed_at":"2026-08-07T14:07:22.834050Z","title":"Li, J., Li, D., Savarese, S., and Hoi, S","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19937","last_updated":"2026-06-16T16:14:58Z","snapshot_observed_at":"2026-08-09T04:16:14.877460Z","submitted_at":"2025-05-26T13:02:44Z","title":"ALAS: An Automatic Latent Alignment Score for Audio Language Models","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:07:22.834050Z"},"links":{"cited_paper":"/paper/2306.05425","citing_paper":"/paper/2505.19937"},"observation_digest":"sha256:5cd1d03818fd5e6074ffe7911056b6bc3e19769d76045b26613ee7b9f45ae0f9","observation_id":"0b8de5be-e226-4aab-a95d-1bee71a71793","resolution":{"observed_at":"2026-08-07T14:07:22.834050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:07:24.510020Z","title":"Montreal forced aligner: Trainable text- speech alignment using kaldi","venue":null,"work_id":"aad67301-cef9-4e52-a439-f4af8b33c1c4","year":2017},"citing_paper":{"arxiv_id":"2505.19937","last_updated":"2026-06-16T16:14:58Z","snapshot_observed_at":"2026-08-09T04:16:14.877460Z","submitted_at":"2025-05-26T13:02:44Z","title":"ALAS: An Automatic Latent Alignment Score for Audio Language Models","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:07:22.886727Z"},"links":{"citing_paper":"/paper/2505.19937"},"observation_digest":"sha256:5c0bdd3e6a4ea25bc0c731d17ecfa6baeae982b728abc86b3eb07d6a4c65fe8a","observation_id":"40d0e662-d768-4050-b547-09b89b29de55","resolution":{"observed_at":"2026-08-07T14:07:24.565292Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:07:24.364783Z","title":"The 5 ALAS: Measuring Latent Speech-Text Alignment For Spoken Language Understanding In Multimodal LLMs kaldi speech recognition toolkit","venue":null,"work_id":"4179e090-7e19-4aae-bf88-37bc89241fd5","year":2011},"citing_paper":{"arxiv_id":"2505.19937","last_updated":"2026-06-16T16:14:58Z","snapshot_observed_at":"2026-08-09T04:16:14.877460Z","submitted_at":"2025-05-26T13:02:44Z","title":"ALAS: An Automatic Latent Alignment Score for Audio Language Models","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:07:23.016716Z"},"links":{"citing_paper":"/paper/2505.19937"},"observation_digest":"sha256:7201986e576887c5ba913600c5fbef50dab545794dbf55f9c97ef00a8684952c","observation_id":"ea1ca65f-c90e-4d56-ba24-7e9ba8b2ebd9","resolution":{"observed_at":"2026-08-07T14:07:24.448199Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.00168","last_updated":"2025-05-17T15:25:50Z","snapshot_observed_at":"2026-07-06T19:24:52.534713Z","submitted_at":"2024-09-30T19:17:46Z","title":"SSR: Alignment-Aware Modality Connector for Speech Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.00168","snapshot_observed_at":"2026-08-07T14:07:23.282165Z","title":"Ssr: Alignment-aware modality connector for speech lan- guage models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19937","last_updated":"2026-06-16T16:14:58Z","snapshot_observed_at":"2026-08-09T04:16:14.877460Z","submitted_at":"2025-05-26T13:02:44Z","title":"ALAS: An Automatic Latent Alignment Score for Audio Language Models","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:07:23.282165Z"},"links":{"cited_paper":"/paper/2410.00168","citing_paper":"/paper/2505.19937"},"observation_digest":"sha256:752ebb82f330a5a714b1eeb903d48760b9a03189b0a92fbb9d32c3b494eb7e15","observation_id":"022b5e44-29a8-4f66-be7d-462e045deee4","resolution":{"observed_at":"2026-08-07T14:07:23.282165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.13289","last_updated":"2024-04-08T06:12:52Z","snapshot_observed_at":"2026-08-02T21:51:36.809095Z","submitted_at":"2023-10-20T05:41:57Z","title":"SALMONN: Towards Generic Hearing Abilities for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.13289","snapshot_observed_at":"2026-08-07T14:07:23.341592Z","title":"Salmonn: Towards generic hearing abilities for large language models.arXiv preprint arXiv:2310.13289,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19937","last_updated":"2026-06-16T16:14:58Z","snapshot_observed_at":"2026-08-09T04:16:14.877460Z","submitted_at":"2025-05-26T13:02:44Z","title":"ALAS: An Automatic Latent Alignment Score for Audio Language Models","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:07:23.341592Z"},"links":{"cited_paper":"/paper/2310.13289","citing_paper":"/paper/2505.19937"},"observation_digest":"sha256:2cbfb27c26d49c8945f6fe9a4bfc246d64915d96f03d64c7770133d0a7c27c19","observation_id":"e4c78260-337a-4ee4-8ff8-73621a02d77b","resolution":{"observed_at":"2026-08-07T14:07:23.341592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-07T14:07:23.446712Z","title":"stanford","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19937","last_updated":"2026-06-16T16:14:58Z","snapshot_observed_at":"2026-08-09T04:16:14.877460Z","submitted_at":"2025-05-26T13:02:44Z","title":"ALAS: An Automatic Latent Alignment Score for Audio Language Models","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:07:23.446712Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2505.19937"},"observation_digest":"sha256:f04ab6847e8bc7c8e4bfac6d2649e647056a720f417c401a298ffbaf6239f178","observation_id":"2ad01c76-6895-4f58-90ea-6e42eb139049","resolution":{"observed_at":"2026-08-07T14:07:23.446712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16020","last_updated":"2025-05-06T00:52:19Z","snapshot_observed_at":"2026-08-09T08:14:08.234350Z","submitted_at":"2024-06-23T05:40:26Z","title":"AudioBench: A Universal Benchmark for Audio Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16020","snapshot_observed_at":"2026-08-07T14:07:23.503947Z","title":"Wu, J., Gaur, Y ., Chen, Z., Zhou, L., Zhu, Y ., Wang, T., Li, J., Liu, S., Ren, B., Liu, L., et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19937","last_updated":"2026-06-16T16:14:58Z","snapshot_observed_at":"2026-08-09T04:16:14.877460Z","submitted_at":"2025-05-26T13:02:44Z","title":"ALAS: An Automatic Latent Alignment Score for Audio Language Models","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:07:23.503947Z"},"links":{"cited_paper":"/paper/2406.16020","citing_paper":"/paper/2505.19937"},"observation_digest":"sha256:87efd36e6742931b8250e5addf342828c8deb36c0fd29a2ceefa81ed808022a7","observation_id":"20831a34-18e7-4c68-9a0e-3efe59b7320f","resolution":{"observed_at":"2026-08-07T14:07:23.503947Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11190","last_updated":"2024-11-05T02:27:57Z","snapshot_observed_at":"2026-07-06T19:33:34.819837Z","submitted_at":"2024-10-15T02:10:45Z","title":"Mini-Omni2: Towards Open-source GPT-4o with Vision, Speech and Duplex Capabilities","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.11190","snapshot_observed_at":"2026-08-07T14:07:23.623745Z","title":"and Wu, C","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19937","last_updated":"2026-06-16T16:14:58Z","snapshot_observed_at":"2026-08-09T04:16:14.877460Z","submitted_at":"2025-05-26T13:02:44Z","title":"ALAS: An Automatic Latent Alignment Score for Audio Language Models","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:07:23.623745Z"},"links":{"cited_paper":"/paper/2410.11190","citing_paper":"/paper/2505.19937"},"observation_digest":"sha256:3e1c042ddf6d13b81f54b67f93f0b7b2ef20dcf8fb4268d4fa2b21c677d99956","observation_id":"507516f7-2aaf-42b5-9c23-527be28a2e5d","resolution":{"observed_at":"2026-08-07T14:07:23.623745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12226","last_updated":"2025-09-08T07:04:17Z","snapshot_observed_at":"2026-07-06T17:32:15.447061Z","submitted_at":"2024-02-19T15:33:10Z","title":"AnyGPT: Unified Multimodal LLM with Discrete Sequence Modeling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12226","snapshot_observed_at":"2026-08-07T14:07:23.738043Z","title":"Anygpt: Unified multimodal llm with discrete sequence modeling","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19937","last_updated":"2026-06-16T16:14:58Z","snapshot_observed_at":"2026-08-09T04:16:14.877460Z","submitted_at":"2025-05-26T13:02:44Z","title":"ALAS: An Automatic Latent Alignment Score for Audio Language Models","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:07:23.738043Z"},"links":{"cited_paper":"/paper/2402.12226","citing_paper":"/paper/2505.19937"},"observation_digest":"sha256:927959059e5972b831cab37e43fe03dc70344183dc26923d6e4564433ad5834b","observation_id":"272009db-ab9b-447d-a45b-7dacbfc765b0","resolution":{"observed_at":"2026-08-07T14:07:23.738043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:07:23.830824Z","title":"Video-LLaMA: An instruction-tuned audio-visual language model for video understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19937","last_updated":"2026-06-16T16:14:58Z","snapshot_observed_at":"2026-08-09T04:16:14.877460Z","submitted_at":"2025-05-26T13:02:44Z","title":"ALAS: An Automatic Latent Alignment Score for Audio Language Models","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:07:23.830824Z"},"links":{"citing_paper":"/paper/2505.19937"},"observation_digest":"sha256:81eea1510f99b071d0ad24413e4e7342c94dac9f41d5f73d284ebd1659aa510e","observation_id":"905bd063-3264-4878-a381-fae90558398e","resolution":{"observed_at":"2026-08-07T14:07:23.830824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00656","last_updated":"2024-09-21T15:27:30Z","snapshot_observed_at":"2026-08-09T20:04:27.847882Z","submitted_at":"2024-03-31T12:01:32Z","title":"WavLLM: Towards Robust and Adaptive Speech Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00656","snapshot_observed_at":"2026-08-07T14:07:22.593442Z","title":"Wavllm: Towards robust and adaptive speech large language model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19937","last_updated":"2026-06-16T16:14:58Z","snapshot_observed_at":"2026-08-09T04:16:14.877460Z","submitted_at":"2025-05-26T13:02:44Z","title":"ALAS: An Automatic Latent Alignment Score for Audio Language Models","version":3},"reference_index":2006,"source":"pdf_text","source_observed_at":"2026-08-07T14:07:22.593442Z"},"links":{"cited_paper":"/paper/2404.00656","citing_paper":"/paper/2505.19937"},"observation_digest":"sha256:42d6b8d67bdbe79d8b21489f1519f0db3e1a82c046107d65efbe3022d2b3c025","observation_id":"c481c263-ae91-4edd-b67e-aece03537254","resolution":{"observed_at":"2026-08-07T14:07:22.593442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.04160","last_updated":"2023-05-22T02:37:02Z","snapshot_observed_at":"2026-08-03T10:34:58.776935Z","submitted_at":"2023-05-07T02:25:42Z","title":"X-LLM: Bootstrapping Advanced Large Language Models by Treating Multi-Modalities as Foreign Languages","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.04160","snapshot_observed_at":"2026-08-07T14:07:22.142203Z","title":"X-llm: Bootstrapping advanced large language models by treating multi-modalities as foreign languages","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19937","last_updated":"2026-06-16T16:14:58Z","snapshot_observed_at":"2026-08-09T04:16:14.877460Z","submitted_at":"2025-05-26T13:02:44Z","title":"ALAS: An Automatic Latent Alignment Score for Audio Language Models","version":3},"reference_index":2008,"source":"pdf_text","source_observed_at":"2026-08-07T14:07:22.142203Z"},"links":{"cited_paper":"/paper/2305.04160","citing_paper":"/paper/2505.19937"},"observation_digest":"sha256:a60d54b4bcc6927e9c7c6d0bb9ecf2be34a6896ea1034df29d68a5e2d0440081","observation_id":"01e6943c-7841-4421-ba24-c3679471688e","resolution":{"observed_at":"2026-08-07T14:07:22.142203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18517","last_updated":"2025-05-24T05:28:22Z","snapshot_observed_at":"2026-08-09T04:18:06.978746Z","submitted_at":"2025-05-24T05:28:22Z","title":"LiSTEN: Learning Soft Token Embeddings for Neural Audio LLMs","version":1},"cited_work":{"arxiv_id":"2505.18517","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.18517","snapshot_observed_at":"2026-08-07T14:07:24.113043Z","title":"LiSTEN: Learning Soft Token Embeddings for Neural Audio LLMs","venue":"cs.AI","work_id":"5f7ce2ca-4e48-4f3b-9ec9-4799341846b9","year":2025},"citing_paper":{"arxiv_id":"2505.19937","last_updated":"2026-06-16T16:14:58Z","snapshot_observed_at":"2026-08-09T04:16:14.877460Z","submitted_at":"2025-05-26T13:02:44Z","title":"ALAS: An Automatic Latent Alignment Score for Audio Language Models","version":3},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-07T14:07:22.953311Z"},"links":{"cited_paper":"/paper/2505.18517","citing_paper":"/paper/2505.19937"},"observation_digest":"sha256:92fefc0228ec1bd8be3a34403dae19cfde386fa535263447f3fe075c331eeb09","observation_id":"4275cce0-b4bc-449c-ab99-cf883ff0d518","resolution":{"observed_at":"2026-08-07T14:07:24.190776Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.10084","last_updated":"2019-08-27T08:50:17Z","snapshot_observed_at":"2026-07-06T08:17:05.681370Z","submitted_at":"2019-08-27T08:50:17Z","title":"Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.10084","snapshot_observed_at":"2026-08-07T14:07:23.188014Z","title":"Rubenstein, P","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2505.19937","last_updated":"2026-06-16T16:14:58Z","snapshot_observed_at":"2026-08-09T04:16:14.877460Z","submitted_at":"2025-05-26T13:02:44Z","title":"ALAS: An Automatic Latent Alignment Score for Audio Language Models","version":3},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-07T14:07:23.188014Z"},"links":{"cited_paper":"/paper/1908.10084","citing_paper":"/paper/2505.19937"},"observation_digest":"sha256:368636bea0ab055c1b321f6e0290159e047efc1a5572fb32d11f7eb9b1927f20","observation_id":"171b07cc-0e63-4c17-adaa-75eadafd4fd2","resolution":{"observed_at":"2026-08-07T14:07:23.188014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.11129","last_updated":"2020-10-23T01:53:58Z","snapshot_observed_at":"2026-08-09T11:53:42.244015Z","submitted_at":"2020-05-22T12:06:46Z","title":"Glow-TTS: A Generative Flow for Text-to-Speech via Monotonic Alignment Search","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.11129","snapshot_observed_at":"2026-08-07T14:07:22.739092Z","title":"Li, B., Zhang, Y ., Chen, L., Wang, J., Pu, F., Yang, J., Li, C., and Liu, Z","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2505.19937","last_updated":"2026-06-16T16:14:58Z","snapshot_observed_at":"2026-08-09T04:16:14.877460Z","submitted_at":"2025-05-26T13:02:44Z","title":"ALAS: An Automatic Latent Alignment Score for Audio Language Models","version":3},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-07T14:07:22.739092Z"},"links":{"cited_paper":"/paper/2005.11129","citing_paper":"/paper/2505.19937"},"observation_digest":"sha256:a25cb8a4459f6cff07e508f699ffed20bc51623f824c55bbe8d8e3944b8bea11","observation_id":"797a0878-61ed-43b0-9bde-1b475a03866f","resolution":{"observed_at":"2026-08-07T14:07:22.739092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-07T14:07:23.097224Z","title":"org/abs/2212.04356","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.19937","last_updated":"2026-06-16T16:14:58Z","snapshot_observed_at":"2026-08-09T04:16:14.877460Z","submitted_at":"2025-05-26T13:02:44Z","title":"ALAS: An Automatic Latent Alignment Score for Audio Language Models","version":3},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T14:07:23.097224Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2505.19937"},"observation_digest":"sha256:05bbc36c7ceba7a8a20036addf1fdcc0d532fd6ea696c999c2197ae08454e3de","observation_id":"653a531d-516d-43c4-a81d-4a0d21144b4e","resolution":{"observed_at":"2026-08-07T14:07:23.097224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.05187","last_updated":"2023-12-08T17:18:42Z","snapshot_observed_at":"2026-08-06T14:36:57.042438Z","submitted_at":"2023-12-08T17:18:42Z","title":"Seamless: Multilingual Expressive and Streaming Speech Translation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.05187","snapshot_observed_at":"2026-08-07T14:07:21.971099Z","title":"C., Dale, D., Dong, N., Duppenthaler, M., Duquenne, P.-A., Ellis, B., Elsahar, H., Haaheim, J., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19937","last_updated":"2026-06-16T16:14:58Z","snapshot_observed_at":"2026-08-09T04:16:14.877460Z","submitted_at":"2025-05-26T13:02:44Z","title":"ALAS: An Automatic Latent Alignment Score for Audio Language Models","version":3},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T14:07:21.971099Z"},"links":{"cited_paper":"/paper/2312.05187","citing_paper":"/paper/2505.19937"},"observation_digest":"sha256:d399e789805f378aa4db7caa4a47825773805fe8fc45996da6f859bcf83ab907","observation_id":"4c46a8f5-927f-4f61-8981-28f0fa111913","resolution":{"observed_at":"2026-08-07T14:07:21.971099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06500","last_updated":"2023-06-15T08:00:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-11T00:38:10Z","title":"InstructBLIP: Towards General-purpose Vision-Language Models with Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06500","snapshot_observed_at":"2026-08-07T14:07:22.328026Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19937","last_updated":"2026-06-16T16:14:58Z","snapshot_observed_at":"2026-08-09T04:16:14.877460Z","submitted_at":"2025-05-26T13:02:44Z","title":"ALAS: An Automatic Latent Alignment Score for Audio Language Models","version":3},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T14:07:22.328026Z"},"links":{"cited_paper":"/paper/2305.06500","citing_paper":"/paper/2505.19937"},"observation_digest":"sha256:fc8f9722e366b4282d2b89dcbd61f796eae18e52a6d4fa5f4259fe3e22c3882e","observation_id":"09b101c0-a0f2-4d13-ba31-d07cf36a437f","resolution":{"observed_at":"2026-08-07T14:07:22.328026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.19937","last_updated":"2026-06-16T16:14:58Z","latest_version":3,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-09T04:16:14.877460Z","submitted_at":"2025-05-26T13:02:44Z","title":"ALAS: An Automatic Latent Alignment Score for Audio Language Models"},"reference_resolution":{"displayed":24,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":19,"verified_exact":1,"verified_fuzzy":4},"total_outbound_references":24},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 24 of 24 outbound references and 0 inbound Pith citation observations for arXiv:2505.19937."}