{"as_of":"2026-08-19T20:49:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:75ca8d846c788df25c1100632503d37bf642ece64fac80d5afac9dd8508f05d1","coverage":[{"denominator":40,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T20:17:33.475816Z","state":"measured"},{"denominator":41,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":41,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T20:17:33.349929Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-15T20:17:33.661042Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.13338","last_updated":"2025-06-03T04:11:48Z","snapshot_observed_at":"2026-08-18T22:14:01.919906Z","submitted_at":"2025-05-19T16:47:46Z","title":"Contextual Paralinguistic Data Creation for Multi-Modal Speech-LLM: Data Condensation and Spoken QA Generation","version":2},"cited_work":{"arxiv_id":"2505.13338","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.13338","snapshot_observed_at":"2026-08-15T20:17:33.661042Z","title":"Contextual Paralinguistic Data Creation for Multi-Modal Speech-LLM: Data Condensation and Spoken QA Generation","venue":"cs.CL","work_id":"5bdfd176-a700-4226-a456-eac824b9e7ae","year":2025},"citing_paper":{"arxiv_id":"2505.13338","last_updated":"2025-06-03T04:11:48Z","snapshot_observed_at":"2026-08-18T22:14:01.919906Z","submitted_at":"2025-05-19T16:47:46Z","title":"Contextual Paralinguistic Data Creation for Multi-Modal Speech-LLM: Data Condensation and Spoken QA Generation","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T20:17:33.349929Z"},"links":{"cited_paper":"/paper/2505.13338","citing_paper":"/paper/2505.13338"},"observation_digest":"sha256:c81d416c1e984852fd97c7b0133f052b89fdd88a2f1df8078e57c47e69d99767","observation_id":"5b3e0b13-e110-4c94-b1d6-097889e13798","resolution":{"observed_at":"2026-08-15T20:17:33.666296Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.13338/citation-record","integrity":"/paper/2505.13338/integrity","json":"/paper/2505.13338/citation-record.json","paper":"/paper/2505.13338"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:17:33.928233Z","title":"Recent speech-LLMs, such as GPT-4 [1], Qwen-audio [2, 3], SALMONN [4], and MERaLiON-AudioLLM [5, 6], have demonstrated remarkable performance in handling speech-based tasks","venue":null,"work_id":"8c79b158-c41f-41f8-8418-512c7031385e","year":null},"citing_paper":{"arxiv_id":"2505.13338","last_updated":"2025-06-03T04:11:48Z","snapshot_observed_at":"2026-08-18T22:14:01.919906Z","submitted_at":"2025-05-19T16:47:46Z","title":"Contextual Paralinguistic Data Creation for Multi-Modal Speech-LLM: Data Condensation and Spoken QA Generation","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T20:17:33.345621Z"},"links":{"citing_paper":"/paper/2505.13338"},"observation_digest":"sha256:8a629b812b2891690ae91d92829362bc379dc7c0703a0d5305ccbe35b2965b0a","observation_id":"df2a375e-9c0e-41e4-8847-09a411b397de","resolution":{"observed_at":"2026-08-15T20:17:33.932117Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13338","last_updated":"2025-06-03T04:11:48Z","snapshot_observed_at":"2026-08-18T22:14:01.919906Z","submitted_at":"2025-05-19T16:47:46Z","title":"Contextual Paralinguistic Data Creation for Multi-Modal Speech-LLM: Data Condensation and Spoken QA Generation","version":2},"cited_work":{"arxiv_id":"2505.13338","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.13338","snapshot_observed_at":"2026-08-15T20:17:33.661042Z","title":"Contextual Paralinguistic Data Creation for Multi-Modal Speech-LLM: Data Condensation and Spoken QA Generation","venue":"cs.CL","work_id":"5bdfd176-a700-4226-a456-eac824b9e7ae","year":2025},"citing_paper":{"arxiv_id":"2505.13338","last_updated":"2025-06-03T04:11:48Z","snapshot_observed_at":"2026-08-18T22:14:01.919906Z","submitted_at":"2025-05-19T16:47:46Z","title":"Contextual Paralinguistic Data Creation for Multi-Modal Speech-LLM: Data Condensation and Spoken QA Generation","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T20:17:33.349929Z"},"links":{"cited_paper":"/paper/2505.13338","citing_paper":"/paper/2505.13338"},"observation_digest":"sha256:c81d416c1e984852fd97c7b0133f052b89fdd88a2f1df8078e57c47e69d99767","observation_id":"5b3e0b13-e110-4c94-b1d6-097889e13798","resolution":{"observed_at":"2026-08-15T20:17:33.666296Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:17:33.918212Z","title":"What is the content in the audio from the text transcript?","venue":null,"work_id":"225dc37e-6aaa-4e22-833f-562286956677","year":null},"citing_paper":{"arxiv_id":"2505.13338","last_updated":"2025-06-03T04:11:48Z","snapshot_observed_at":"2026-08-18T22:14:01.919906Z","submitted_at":"2025-05-19T16:47:46Z","title":"Contextual Paralinguistic Data Creation for Multi-Modal Speech-LLM: Data Condensation and Spoken QA Generation","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T20:17:33.353733Z"},"links":{"citing_paper":"/paper/2505.13338"},"observation_digest":"sha256:b89d68f6053aa450f419b9422fe24a8245bcc416cb9ef013edd3db74ef097752","observation_id":"44a15b1d-4201-4976-9b78-db81f5b07cdf","resolution":{"observed_at":"2026-08-15T20:17:33.921636Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:17:33.907432Z","title":null,"venue":null,"work_id":"d6135721-de12-4455-8081-bdc0ec9c4f6d","year":2025},"citing_paper":{"arxiv_id":"2505.13338","last_updated":"2025-06-03T04:11:48Z","snapshot_observed_at":"2026-08-18T22:14:01.919906Z","submitted_at":"2025-05-19T16:47:46Z","title":"Contextual Paralinguistic Data Creation for Multi-Modal Speech-LLM: Data Condensation and Spoken QA Generation","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T20:17:33.357222Z"},"links":{"citing_paper":"/paper/2505.13338"},"observation_digest":"sha256:711c8e373ec1b1a257fef359d776b317292e8e63e26f6535d5b45de2dc3dd901","observation_id":"7c3ff951-5a41-4ef3-b9a1-8ddfa4e8a78d","resolution":{"observed_at":"2026-08-15T20:17:33.911818Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:17:33.896829Z","title":null,"venue":null,"work_id":"f9871ef0-d61b-4448-a8f1-e91800775d4b","year":null},"citing_paper":{"arxiv_id":"2505.13338","last_updated":"2025-06-03T04:11:48Z","snapshot_observed_at":"2026-08-18T22:14:01.919906Z","submitted_at":"2025-05-19T16:47:46Z","title":"Contextual Paralinguistic Data Creation for Multi-Modal Speech-LLM: Data Condensation and Spoken QA Generation","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T20:17:33.360522Z"},"links":{"citing_paper":"/paper/2505.13338"},"observation_digest":"sha256:ac710d77eb7761dbd34a76af84e7514f6276d699480a62e1b17f821ddc5d084e","observation_id":"d1a5bcd2-cc09-493b-a09b-067d749df2e0","resolution":{"observed_at":"2026-08-15T20:17:33.900926Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:17:33.364103Z","title":"Our framework con- sists of pseudo paralinguistic label-based data condensation and LLM-based CPQA generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.13338","last_updated":"2025-06-03T04:11:48Z","snapshot_observed_at":"2026-08-18T22:14:01.919906Z","submitted_at":"2025-05-19T16:47:46Z","title":"Contextual Paralinguistic Data Creation for Multi-Modal Speech-LLM: Data Condensation and Spoken QA Generation","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T20:17:33.364103Z"},"links":{"citing_paper":"/paper/2505.13338"},"observation_digest":"sha256:0715bced88145add0a83d9b11e6b0c2ef69044286f8cd9c58f0a948c58c38986","observation_id":"c8563fb2-e5da-44cf-bd61-a3d7a911e0e5","resolution":{"observed_at":"2026-08-15T20:17:33.364103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:17:33.886605Z","title":null,"venue":null,"work_id":"26bfc673-71e7-4924-bfaf-636a154f8e5d","year":null},"citing_paper":{"arxiv_id":"2505.13338","last_updated":"2025-06-03T04:11:48Z","snapshot_observed_at":"2026-08-18T22:14:01.919906Z","submitted_at":"2025-05-19T16:47:46Z","title":"Contextual Paralinguistic Data Creation for Multi-Modal Speech-LLM: Data Condensation and Spoken QA Generation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T20:17:33.367822Z"},"links":{"citing_paper":"/paper/2505.13338"},"observation_digest":"sha256:a2e30ef93bac0b42727377db21f5016d23bb7a4a7a5137af62a34dab49e0da28","observation_id":"257f1e2b-b648-44d7-81eb-7239a32a713c","resolution":{"observed_at":"2026-08-15T20:17:33.890556Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-15T20:17:33.371023Z","title":"GPT-4 technical report,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.13338","last_updated":"2025-06-03T04:11:48Z","snapshot_observed_at":"2026-08-18T22:14:01.919906Z","submitted_at":"2025-05-19T16:47:46Z","title":"Contextual Paralinguistic Data Creation for Multi-Modal Speech-LLM: Data Condensation and Spoken QA Generation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T20:17:33.371023Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.13338"},"observation_digest":"sha256:881b391aded902a0a5ee28a2e14e94b8728788a269bb167a351b6d0d899ff675","observation_id":"a8c59dad-2984-4c64-b67b-03064de6c960","resolution":{"observed_at":"2026-08-15T20:17:33.371023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-08-07T10:17:55.688598Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-08-15T20:17:33.374448Z","title":"Qwen-audio: Advancing universal audio understand- ing via unified large-scale audio-language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.13338","last_updated":"2025-06-03T04:11:48Z","snapshot_observed_at":"2026-08-18T22:14:01.919906Z","submitted_at":"2025-05-19T16:47:46Z","title":"Contextual Paralinguistic Data Creation for Multi-Modal Speech-LLM: Data Condensation and Spoken QA Generation","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T20:17:33.374448Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2505.13338"},"observation_digest":"sha256:c1dcbfc552e235511a1cbbf894a886dbb644eda94551a255a72d470ddc11cb91","observation_id":"d4e56222-2487-41b0-b0f7-c939eed97885","resolution":{"observed_at":"2026-08-15T20:17:33.374448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10759","last_updated":"2024-07-15T14:38:09Z","snapshot_observed_at":"2026-08-14T01:27:16.843576Z","submitted_at":"2024-07-15T14:38:09Z","title":"Qwen2-Audio Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10759","snapshot_observed_at":"2026-08-15T20:17:33.377815Z","title":"Qwen2-audio technical re- port,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13338","last_updated":"2025-06-03T04:11:48Z","snapshot_observed_at":"2026-08-18T22:14:01.919906Z","submitted_at":"2025-05-19T16:47:46Z","title":"Contextual Paralinguistic Data Creation for Multi-Modal Speech-LLM: Data Condensation and Spoken QA Generation","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T20:17:33.377815Z"},"links":{"cited_paper":"/paper/2407.10759","citing_paper":"/paper/2505.13338"},"observation_digest":"sha256:14a2e5c363d494367e00122527592597cc7201c9e2a01de41ef11d0f5ce91569","observation_id":"8ec7c9d2-eead-4631-8149-034f16ba74cb","resolution":{"observed_at":"2026-08-15T20:17:33.377815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.13289","last_updated":"2024-04-08T06:12:52Z","snapshot_observed_at":"2026-08-14T05:30:13.223510Z","submitted_at":"2023-10-20T05:41:57Z","title":"SALMONN: Towards Generic Hearing Abilities for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.13289","snapshot_observed_at":"2026-08-15T20:17:33.380885Z","title":"Salmonn: Towards generic hearing abilities for large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.13338","last_updated":"2025-06-03T04:11:48Z","snapshot_observed_at":"2026-08-18T22:14:01.919906Z","submitted_at":"2025-05-19T16:47:46Z","title":"Contextual Paralinguistic Data Creation for Multi-Modal Speech-LLM: Data Condensation and Spoken QA Generation","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T20:17:33.380885Z"},"links":{"cited_paper":"/paper/2310.13289","citing_paper":"/paper/2505.13338"},"observation_digest":"sha256:887d69b534b51e4ed71b736f17ada512074da073d887245cb96dae615ceb214d","observation_id":"c02a3a55-2109-418b-a084-029faeb96724","resolution":{"observed_at":"2026-08-15T20:17:33.380885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09818","last_updated":"2025-01-16T03:29:23Z","snapshot_observed_at":"2026-08-15T13:23:21.388081Z","submitted_at":"2024-12-13T03:15:05Z","title":"MERaLiON-AudioLLM: Bridging Audio and Language with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09818","snapshot_observed_at":"2026-08-15T20:17:33.384225Z","title":"MERaLiON-AudioLLM: Technical report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13338","last_updated":"2025-06-03T04:11:48Z","snapshot_observed_at":"2026-08-18T22:14:01.919906Z","submitted_at":"2025-05-19T16:47:46Z","title":"Contextual Paralinguistic Data Creation for Multi-Modal Speech-LLM: Data Condensation and Spoken QA Generation","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T20:17:33.384225Z"},"links":{"cited_paper":"/paper/2412.09818","citing_paper":"/paper/2505.13338"},"observation_digest":"sha256:ed563cd36f486c742401d07e96450037410eac1075ec8ecb088250ba5a7c6c57","observation_id":"b47227b3-c8cf-413e-916b-6b0f82b780df","resolution":{"observed_at":"2026-08-15T20:17:33.384225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.11538","last_updated":"2025-09-11T05:26:13Z","snapshot_observed_at":"2026-08-16T07:55:28.523537Z","submitted_at":"2024-12-16T08:15:19Z","title":"MERaLiON-SpeechEncoder: Towards a Speech Foundation Model for Singapore and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.11538","snapshot_observed_at":"2026-08-15T20:17:33.387816Z","title":"Towards a speech foundation model for singapore and beyond,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13338","last_updated":"2025-06-03T04:11:48Z","snapshot_observed_at":"2026-08-18T22:14:01.919906Z","submitted_at":"2025-05-19T16:47:46Z","title":"Contextual Paralinguistic Data Creation for Multi-Modal Speech-LLM: Data Condensation and Spoken QA Generation","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T20:17:33.387816Z"},"links":{"cited_paper":"/paper/2412.11538","citing_paper":"/paper/2505.13338"},"observation_digest":"sha256:cf69b3717a4d77eb6a7a2846505ac86408c960c7e2dd08314116944043b86d60","observation_id":"79ba7230-e884-473a-bbec-18385fee75db","resolution":{"observed_at":"2026-08-15T20:17:33.387816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.03872","last_updated":"2024-06-06T09:02:31Z","snapshot_observed_at":"2026-08-17T21:15:44.958706Z","submitted_at":"2024-06-06T09:02:31Z","title":"BLSP-Emo: Towards Empathetic Large Speech-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.03872","snapshot_observed_at":"2026-08-15T20:17:33.391551Z","title":"BLSP-Emo: Towards empathetic large speech-language mod- els,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13338","last_updated":"2025-06-03T04:11:48Z","snapshot_observed_at":"2026-08-18T22:14:01.919906Z","submitted_at":"2025-05-19T16:47:46Z","title":"Contextual Paralinguistic Data Creation for Multi-Modal Speech-LLM: Data Condensation and Spoken QA Generation","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T20:17:33.391551Z"},"links":{"cited_paper":"/paper/2406.03872","citing_paper":"/paper/2505.13338"},"observation_digest":"sha256:3925a1fee0b860f82fb2950f53007aa04a48a15bf9451b914776b4d0de49486b","observation_id":"c1a5cc0e-951c-4a5a-92d5-eb332a8eccf7","resolution":{"observed_at":"2026-08-15T20:17:33.391551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.12925","last_updated":"2023-06-22T14:37:54Z","snapshot_observed_at":"2026-08-07T01:18:02.068918Z","submitted_at":"2023-06-22T14:37:54Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.12925","snapshot_observed_at":"2026-08-15T20:17:33.394954Z","title":"AudioPaLM: A large language model that can speak and listen,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.13338","last_updated":"2025-06-03T04:11:48Z","snapshot_observed_at":"2026-08-18T22:14:01.919906Z","submitted_at":"2025-05-19T16:47:46Z","title":"Contextual Paralinguistic Data Creation for Multi-Modal Speech-LLM: Data Condensation and Spoken QA Generation","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T20:17:33.394954Z"},"links":{"cited_paper":"/paper/2306.12925","citing_paper":"/paper/2505.13338"},"observation_digest":"sha256:d0e9abc22876f47f12c81e7db004daf421dfc91ff9424466657fa953769853c2","observation_id":"bcac46d7-5359-459f-a598-dae8ec7ca2c0","resolution":{"observed_at":"2026-08-15T20:17:33.394954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.04673","last_updated":"2024-07-03T02:38:03Z","snapshot_observed_at":"2026-08-16T14:54:18.806254Z","submitted_at":"2023-10-07T03:17:59Z","title":"LauraGPT: Listen, Attend, Understand, and Regenerate Audio with GPT","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.04673","snapshot_observed_at":"2026-08-15T20:17:33.399189Z","title":"LauraGPT: Listen, attend, understand, and regenerate audio with GPT,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.13338","last_updated":"2025-06-03T04:11:48Z","snapshot_observed_at":"2026-08-18T22:14:01.919906Z","submitted_at":"2025-05-19T16:47:46Z","title":"Contextual Paralinguistic Data Creation for Multi-Modal Speech-LLM: Data Condensation and Spoken QA Generation","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T20:17:33.399189Z"},"links":{"cited_paper":"/paper/2310.04673","citing_paper":"/paper/2505.13338"},"observation_digest":"sha256:b606d49b2b88c3e03e8f8b56ef8f40ce4bd66e85ee298356727361d9f1968bbe","observation_id":"f5e1c955-edc6-462f-bfaf-0e48780e59b4","resolution":{"observed_at":"2026-08-15T20:17:33.399189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:17:33.876788Z","title":"Advancing large lan- guage models to capture varied speaking styles and respond prop- erly in spoken conversations,","venue":null,"work_id":"4aa6c6eb-4c1c-4b32-8998-527940bdb096","year":2024},"citing_paper":{"arxiv_id":"2505.13338","last_updated":"2025-06-03T04:11:48Z","snapshot_observed_at":"2026-08-18T22:14:01.919906Z","submitted_at":"2025-05-19T16:47:46Z","title":"Contextual Paralinguistic Data Creation for Multi-Modal Speech-LLM: Data Condensation and Spoken QA Generation","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T20:17:33.402172Z"},"links":{"citing_paper":"/paper/2505.13338"},"observation_digest":"sha256:7f9349b83ebc006f7291594b7fa6e1ca277a0dae5dfc5484c8f04762a586f439","observation_id":"7cd1ed08-992a-426b-a7d7-721c2ccef8fc","resolution":{"observed_at":"2026-08-15T20:17:33.880417Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00916","last_updated":"2024-05-28T14:26:28Z","snapshot_observed_at":"2026-08-19T03:28:57.113432Z","submitted_at":"2023-09-02T11:46:05Z","title":"BLSP: Bootstrapping Language-Speech Pre-training via Behavior Alignment of Continuation Writing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00916","snapshot_observed_at":"2026-08-15T20:17:33.405082Z","title":"BLSP: Bootstrapping language-speech pre-training via behavior alignment of continuation writing,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13338","last_updated":"2025-06-03T04:11:48Z","snapshot_observed_at":"2026-08-18T22:14:01.919906Z","submitted_at":"2025-05-19T16:47:46Z","title":"Contextual Paralinguistic Data Creation for Multi-Modal Speech-LLM: Data Condensation and Spoken QA Generation","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T20:17:33.405082Z"},"links":{"cited_paper":"/paper/2309.00916","citing_paper":"/paper/2505.13338"},"observation_digest":"sha256:4a945fa36517effcfef91ffcfc97e53a69d9867287312156d043315f4b22d9ff","observation_id":"adf22b68-6130-4741-bcf3-9340321f1889","resolution":{"observed_at":"2026-08-15T20:17:33.405082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:17:33.864651Z","title":"Paralinguistics-aware speech- empowered large language models for natural conversation,","venue":null,"work_id":"b59565e1-837b-4707-939a-15f7e328c8b7","year":2024},"citing_paper":{"arxiv_id":"2505.13338","last_updated":"2025-06-03T04:11:48Z","snapshot_observed_at":"2026-08-18T22:14:01.919906Z","submitted_at":"2025-05-19T16:47:46Z","title":"Contextual Paralinguistic Data Creation for Multi-Modal Speech-LLM: Data Condensation and Spoken QA Generation","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T20:17:33.409218Z"},"links":{"citing_paper":"/paper/2505.13338"},"observation_digest":"sha256:34447dfacece974f37b7e5a3190b47f82d6b8b282af7a3b6975a3a25ceb9d70c","observation_id":"bb7090e5-9f39-421b-b88a-f8e163372e9a","resolution":{"observed_at":"2026-08-15T20:17:33.868245Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01162","last_updated":"2025-05-19T22:01:39Z","snapshot_observed_at":"2026-08-16T13:13:32.629020Z","submitted_at":"2024-10-02T01:32:47Z","title":"Frozen Large Language Models Can Perceive Paralinguistic Aspects of Speech","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.01162","snapshot_observed_at":"2026-08-15T20:17:33.412848Z","title":"Frozen large language mod- els can perceive paralinguistic aspects of speech,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13338","last_updated":"2025-06-03T04:11:48Z","snapshot_observed_at":"2026-08-18T22:14:01.919906Z","submitted_at":"2025-05-19T16:47:46Z","title":"Contextual Paralinguistic Data Creation for Multi-Modal Speech-LLM: Data Condensation and Spoken QA Generation","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T20:17:33.412848Z"},"links":{"cited_paper":"/paper/2410.01162","citing_paper":"/paper/2505.13338"},"observation_digest":"sha256:4bdd14427f8b9ccc75c78545cc8f04b49a282c3d0fdf4ddf5340ccf74bbcfcd7","observation_id":"6a3ad9af-4b75-44f7-8891-2fe02c825a7a","resolution":{"observed_at":"2026-08-15T20:17:33.412848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:17:33.854311Z","title":"AudioBench: A universal benchmark for audio large language models,","venue":null,"work_id":"3fcfc64b-d12c-4ae0-8099-2e6f3e88812d","year":2025},"citing_paper":{"arxiv_id":"2505.13338","last_updated":"2025-06-03T04:11:48Z","snapshot_observed_at":"2026-08-18T22:14:01.919906Z","submitted_at":"2025-05-19T16:47:46Z","title":"Contextual Paralinguistic Data Creation for Multi-Modal Speech-LLM: Data Condensation and Spoken QA Generation","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T20:17:33.415869Z"},"links":{"citing_paper":"/paper/2505.13338"},"observation_digest":"sha256:91f4f566427d446ed8276a90029a83106cd9de098c462f2fb50df2f5c17105f6","observation_id":"5cad0500-702b-4260-805d-dfb6d0be4ad9","resolution":{"observed_at":"2026-08-15T20:17:33.858006Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:17:33.843757Z","title":"Dynamic-superb: To- wards a dynamic, collaborative, and comprehensive instruction- tuning benchmark for speech,","venue":null,"work_id":"d5aaf18d-ae57-4bf5-9d7b-4427b3c38459","year":2024},"citing_paper":{"arxiv_id":"2505.13338","last_updated":"2025-06-03T04:11:48Z","snapshot_observed_at":"2026-08-18T22:14:01.919906Z","submitted_at":"2025-05-19T16:47:46Z","title":"Contextual Paralinguistic Data Creation for Multi-Modal Speech-LLM: Data Condensation and Spoken QA Generation","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T20:17:33.418994Z"},"links":{"citing_paper":"/paper/2505.13338"},"observation_digest":"sha256:335aa60ba6a78ed9d69357083960105c911c76c3afae5ebc34351caa1c080eb9","observation_id":"40ca13f3-6ee6-43b9-96a4-2eb4d6e4422c","resolution":{"observed_at":"2026-08-15T20:17:33.847956Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:17:33.833413Z","title":"AIR-bench: Benchmark- ing large audio-language models via generative comprehension,","venue":null,"work_id":"5a1b088b-356e-45f9-97fa-3ba1c9f6e3f5","year":2024},"citing_paper":{"arxiv_id":"2505.13338","last_updated":"2025-06-03T04:11:48Z","snapshot_observed_at":"2026-08-18T22:14:01.919906Z","submitted_at":"2025-05-19T16:47:46Z","title":"Contextual Paralinguistic Data Creation for Multi-Modal Speech-LLM: Data Condensation and Spoken QA Generation","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T20:17:33.422609Z"},"links":{"citing_paper":"/paper/2505.13338"},"observation_digest":"sha256:e96c4cdcaebb3b81cf9139b9b60634fd179cc170e37753c36bc31efced744e3d","observation_id":"d7cda837-7c18-4c6c-822a-2c129c3e9a70","resolution":{"observed_at":"2026-08-15T20:17:33.837167Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:17:33.425641Z","title":"Listen, think, and understand,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13338","last_updated":"2025-06-03T04:11:48Z","snapshot_observed_at":"2026-08-18T22:14:01.919906Z","submitted_at":"2025-05-19T16:47:46Z","title":"Contextual Paralinguistic Data Creation for Multi-Modal Speech-LLM: Data Condensation and Spoken QA Generation","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T20:17:33.425641Z"},"links":{"citing_paper":"/paper/2505.13338"},"observation_digest":"sha256:fbc314ae9c38888d20effee28a3c9e14a6c165b6af793db5af100dbaeb706220","observation_id":"b88e64c0-7555-4a25-9946-fbe3044dbbf5","resolution":{"observed_at":"2026-08-15T20:17:33.425641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:17:33.814154Z","title":"MMAU: A mas- sive multi-task audio understanding and reasoning benchmark,","venue":null,"work_id":"a17cff71-ecdb-4b5b-985a-112e1f1144b0","year":2025},"citing_paper":{"arxiv_id":"2505.13338","last_updated":"2025-06-03T04:11:48Z","snapshot_observed_at":"2026-08-18T22:14:01.919906Z","submitted_at":"2025-05-19T16:47:46Z","title":"Contextual Paralinguistic Data Creation for Multi-Modal Speech-LLM: Data Condensation and Spoken QA Generation","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T20:17:33.428590Z"},"links":{"citing_paper":"/paper/2505.13338"},"observation_digest":"sha256:5c5ba09b3ad0ca8eb7965a9e0bdeea0ecd805204735d3c672001bbdc963ba0f0","observation_id":"3c5cccfd-59b3-42fd-aa6f-9f515ba723aa","resolution":{"observed_at":"2026-08-15T20:17:33.818914Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:17:33.803810Z","title":"IEMOCAP: interactive emotional dyadic motion capture database,","venue":null,"work_id":"21beccec-f123-4b1c-9dfe-97c42cda4707","year":2008},"citing_paper":{"arxiv_id":"2505.13338","last_updated":"2025-06-03T04:11:48Z","snapshot_observed_at":"2026-08-18T22:14:01.919906Z","submitted_at":"2025-05-19T16:47:46Z","title":"Contextual Paralinguistic Data Creation for Multi-Modal Speech-LLM: Data Condensation and Spoken QA Generation","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T20:17:33.431691Z"},"links":{"citing_paper":"/paper/2505.13338"},"observation_digest":"sha256:4101a8da8e72e54cd49d4ff230509f686259866935a77160a27603229c32604f","observation_id":"8965e6db-6080-48ac-804c-ad5240d7ae40","resolution":{"observed_at":"2026-08-15T20:17:33.807231Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:17:33.793591Z","title":"MELD: A multimodal multi-party dataset for emo- tion recognition in conversations,","venue":null,"work_id":"b7b24e5f-243a-4989-9fe8-8a6d6d53711c","year":2019},"citing_paper":{"arxiv_id":"2505.13338","last_updated":"2025-06-03T04:11:48Z","snapshot_observed_at":"2026-08-18T22:14:01.919906Z","submitted_at":"2025-05-19T16:47:46Z","title":"Contextual Paralinguistic Data Creation for Multi-Modal Speech-LLM: Data Condensation and Spoken QA Generation","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T20:17:33.434765Z"},"links":{"citing_paper":"/paper/2505.13338"},"observation_digest":"sha256:5b8141c37d6200ebef3ef8fb0830a415e2221e2c1e1a4caadef8aa654f812f33","observation_id":"d012c2ef-7d75-4efe-8248-b05d1ac94826","resolution":{"observed_at":"2026-08-15T20:17:33.797163Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:17:33.782164Z","title":"What’s basic about basic emotions?","venue":null,"work_id":"aa0ab1ca-41d7-4c5b-83cd-ebeea2cc5b74","year":1990},"citing_paper":{"arxiv_id":"2505.13338","last_updated":"2025-06-03T04:11:48Z","snapshot_observed_at":"2026-08-18T22:14:01.919906Z","submitted_at":"2025-05-19T16:47:46Z","title":"Contextual Paralinguistic Data Creation for Multi-Modal Speech-LLM: Data Condensation and Spoken QA Generation","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T20:17:33.438307Z"},"links":{"citing_paper":"/paper/2505.13338"},"observation_digest":"sha256:1dbe2f35982812cf9f7c21a400fec002f179eae6d0edc53499144da1391a0522","observation_id":"a129374a-a85b-4739-941c-7dd619b5a975","resolution":{"observed_at":"2026-08-15T20:17:33.785652Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:17:33.772474Z","title":"Theories of emotion,","venue":null,"work_id":"863308b1-70ed-493c-a18f-ab3ab0335aa2","year":2013},"citing_paper":{"arxiv_id":"2505.13338","last_updated":"2025-06-03T04:11:48Z","snapshot_observed_at":"2026-08-18T22:14:01.919906Z","submitted_at":"2025-05-19T16:47:46Z","title":"Contextual Paralinguistic Data Creation for Multi-Modal Speech-LLM: Data Condensation and Spoken QA Generation","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T20:17:33.441242Z"},"links":{"citing_paper":"/paper/2505.13338"},"observation_digest":"sha256:521786acc0b60ae3d27abb09c41995838b5c4381b5c2ea84e7c304aa3f375970","observation_id":"85b7fc7a-0eb6-4d69-b73d-087401a787b0","resolution":{"observed_at":"2026-08-15T20:17:33.775706Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:17:33.761877Z","title":"EmoBox: Multilingual multi-corpus speech emotion recognition toolkit and benchmark,","venue":null,"work_id":"cdaab0cc-6361-4c87-8dea-252744e7bb69","year":2024},"citing_paper":{"arxiv_id":"2505.13338","last_updated":"2025-06-03T04:11:48Z","snapshot_observed_at":"2026-08-18T22:14:01.919906Z","submitted_at":"2025-05-19T16:47:46Z","title":"Contextual Paralinguistic Data Creation for Multi-Modal Speech-LLM: Data Condensation and Spoken QA Generation","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T20:17:33.444355Z"},"links":{"citing_paper":"/paper/2505.13338"},"observation_digest":"sha256:143656e4b719e354f2d4c09dd54d162ccfdc7a09743fb46cb89183f225f7b94c","observation_id":"2418c4d2-380d-4b51-8d7d-6902ebc7b32e","resolution":{"observed_at":"2026-08-15T20:17:33.765848Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:17:33.751728Z","title":"Evidence for a three-factor the- ory of emotions,","venue":null,"work_id":"1dac6d2c-09c7-48c2-90be-069b324f7631","year":1977},"citing_paper":{"arxiv_id":"2505.13338","last_updated":"2025-06-03T04:11:48Z","snapshot_observed_at":"2026-08-18T22:14:01.919906Z","submitted_at":"2025-05-19T16:47:46Z","title":"Contextual Paralinguistic Data Creation for Multi-Modal Speech-LLM: Data Condensation and Spoken QA Generation","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T20:17:33.447515Z"},"links":{"citing_paper":"/paper/2505.13338"},"observation_digest":"sha256:f8bb1495b67a048f096214ba8249ed08a3db5c3d920ef29220b1e4cf79135014","observation_id":"8bc8255e-2381-4b4b-b1f3-04acb1b2d49b","resolution":{"observed_at":"2026-08-15T20:17:33.755021Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:17:33.741662Z","title":"Goemotions: A dataset of fine-grained emo- tions,","venue":null,"work_id":"3e815c2e-ff1a-4fbc-8fb0-e3ff5a3ed8bd","year":2020},"citing_paper":{"arxiv_id":"2505.13338","last_updated":"2025-06-03T04:11:48Z","snapshot_observed_at":"2026-08-18T22:14:01.919906Z","submitted_at":"2025-05-19T16:47:46Z","title":"Contextual Paralinguistic Data Creation for Multi-Modal Speech-LLM: Data Condensation and Spoken QA Generation","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T20:17:33.450756Z"},"links":{"citing_paper":"/paper/2505.13338"},"observation_digest":"sha256:2223ab9c3f605e6a4a23ef33e56f0ec158bfc25c49d1956e31229d0cfbd99318","observation_id":"5fc62db6-16d6-42cf-accd-f389cbbbabf2","resolution":{"observed_at":"2026-08-15T20:17:33.745284Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:17:33.731020Z","title":"emotion2vec: Self-supervised pre-training for speech emotion representation,","venue":null,"work_id":"a05a82b8-ebfa-4d88-bdf1-3b5b1f5b2857","year":2024},"citing_paper":{"arxiv_id":"2505.13338","last_updated":"2025-06-03T04:11:48Z","snapshot_observed_at":"2026-08-18T22:14:01.919906Z","submitted_at":"2025-05-19T16:47:46Z","title":"Contextual Paralinguistic Data Creation for Multi-Modal Speech-LLM: Data Condensation and Spoken QA Generation","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T20:17:33.454003Z"},"links":{"citing_paper":"/paper/2505.13338"},"observation_digest":"sha256:28e9d8ef0a10cd9821af50826b242cfe54d1de32ff328c3bd8bb6cdc9259daae","observation_id":"90ead142-5439-4f7a-bcd5-0cfd198265af","resolution":{"observed_at":"2026-08-15T20:17:33.734700Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:17:33.457390Z","title":"Dawn of the trans- former era in speech emotion recognition: Closing the valence gap,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.13338","last_updated":"2025-06-03T04:11:48Z","snapshot_observed_at":"2026-08-18T22:14:01.919906Z","submitted_at":"2025-05-19T16:47:46Z","title":"Contextual Paralinguistic Data Creation for Multi-Modal Speech-LLM: Data Condensation and Spoken QA Generation","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T20:17:33.457390Z"},"links":{"citing_paper":"/paper/2505.13338"},"observation_digest":"sha256:bfc39874fafdcd65a3873f45e7e465c1beaec6081a3a4f0311735778ac74af9a","observation_id":"5d0fc0a3-4a9a-4c29-836a-9cf4ef2e8d60","resolution":{"observed_at":"2026-08-15T20:17:33.457390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:17:33.714290Z","title":"Building naturalistic emotionally bal- anced speech corpus by retrievingemotional speech from existing podcast recordings,","venue":null,"work_id":"54f59ad7-332e-4a7e-85b3-0d12f4822716","year":2019},"citing_paper":{"arxiv_id":"2505.13338","last_updated":"2025-06-03T04:11:48Z","snapshot_observed_at":"2026-08-18T22:14:01.919906Z","submitted_at":"2025-05-19T16:47:46Z","title":"Contextual Paralinguistic Data Creation for Multi-Modal Speech-LLM: Data Condensation and Spoken QA Generation","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T20:17:33.460553Z"},"links":{"citing_paper":"/paper/2505.13338"},"observation_digest":"sha256:a6c07fdbc1cad1a2b4fb701769f1d10c4cb3befb8aef9e67ac6b14e6ddf9e935","observation_id":"481c58b7-2554-485f-b02e-aeb833128bff","resolution":{"observed_at":"2026-08-15T20:17:33.718410Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:17:33.463514Z","title":"WavLM: Large-scale self- supervised pre-training for full stack speech processing,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.13338","last_updated":"2025-06-03T04:11:48Z","snapshot_observed_at":"2026-08-18T22:14:01.919906Z","submitted_at":"2025-05-19T16:47:46Z","title":"Contextual Paralinguistic Data Creation for Multi-Modal Speech-LLM: Data Condensation and Spoken QA Generation","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T20:17:33.463514Z"},"links":{"citing_paper":"/paper/2505.13338"},"observation_digest":"sha256:d93d8a6682b6b258d3ac689c56b2f799d73bb355eaf8142554e194d3a53f327c","observation_id":"3cbdafd9-b7a6-4a4b-ac0c-3a9ef94c2ea6","resolution":{"observed_at":"2026-08-15T20:17:33.463514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:17:33.698670Z","title":"Ecapa-tdnn: Emphasized channel attention, propagation and aggregation in tdnn based speaker verification,","venue":null,"work_id":"7dd1059a-021a-447e-ac9d-aa3cb15edd5b","year":2020},"citing_paper":{"arxiv_id":"2505.13338","last_updated":"2025-06-03T04:11:48Z","snapshot_observed_at":"2026-08-18T22:14:01.919906Z","submitted_at":"2025-05-19T16:47:46Z","title":"Contextual Paralinguistic Data Creation for Multi-Modal Speech-LLM: Data Condensation and Spoken QA Generation","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T20:17:33.466518Z"},"links":{"citing_paper":"/paper/2505.13338"},"observation_digest":"sha256:ad3f3f296de52f5d4493593725010659b77125f8f741316d4a031b1f54e23584","observation_id":"26111fcc-14e8-4c9d-8386-3f5270689267","resolution":{"observed_at":"2026-08-15T20:17:33.701994Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:17:33.469808Z","title":"V oxCeleb2: Deep speaker recognition,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.13338","last_updated":"2025-06-03T04:11:48Z","snapshot_observed_at":"2026-08-18T22:14:01.919906Z","submitted_at":"2025-05-19T16:47:46Z","title":"Contextual Paralinguistic Data Creation for Multi-Modal Speech-LLM: Data Condensation and Spoken QA Generation","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T20:17:33.469808Z"},"links":{"citing_paper":"/paper/2505.13338"},"observation_digest":"sha256:d7134d41f5ec7fb0eccc6a252fa775c84b4cd61060be683a5714f1bbfcc013a7","observation_id":"35d844f6-a36d-41b0-a4a0-63ae8a49271c","resolution":{"observed_at":"2026-08-15T20:17:33.469808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:17:33.683420Z","title":"WhisperX: Time- accurate speech transcription of long-form audio,","venue":null,"work_id":"95901536-ac66-4e62-ac26-58a384e0ad12","year":2023},"citing_paper":{"arxiv_id":"2505.13338","last_updated":"2025-06-03T04:11:48Z","snapshot_observed_at":"2026-08-18T22:14:01.919906Z","submitted_at":"2025-05-19T16:47:46Z","title":"Contextual Paralinguistic Data Creation for Multi-Modal Speech-LLM: Data Condensation and Spoken QA Generation","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T20:17:33.472777Z"},"links":{"citing_paper":"/paper/2505.13338"},"observation_digest":"sha256:1c372e0aa1a242b10d4773c27b2530449deb056abf6ca1c7f431b1f40c2a22a3","observation_id":"3a6e8142-01c7-4b17-8889-90906e41acac","resolution":{"observed_at":"2026-08-15T20:17:33.686760Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:17:33.673458Z","title":"The Llama 3 herd of models,","venue":null,"work_id":"a0febdc1-30e1-4fd7-87a1-df9e0bfb2d12","year":2024},"citing_paper":{"arxiv_id":"2505.13338","last_updated":"2025-06-03T04:11:48Z","snapshot_observed_at":"2026-08-18T22:14:01.919906Z","submitted_at":"2025-05-19T16:47:46Z","title":"Contextual Paralinguistic Data Creation for Multi-Modal Speech-LLM: Data Condensation and Spoken QA Generation","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T20:17:33.475816Z"},"links":{"citing_paper":"/paper/2505.13338"},"observation_digest":"sha256:62950bc122509502fbe422a4c8fea8a76712aba5affbc234e008287ff3ba1e61","observation_id":"e96a01a8-e897-4f96-8521-8b45b64ba23a","resolution":{"observed_at":"2026-08-15T20:17:33.676651Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.13338","last_updated":"2025-06-03T04:11:48Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-18T22:14:01.919906Z","submitted_at":"2025-05-19T16:47:46Z","title":"Contextual Paralinguistic Data Creation for Multi-Modal Speech-LLM: Data Condensation and Spoken QA Generation"},"reference_resolution":{"displayed":40,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":19,"verified_exact":1,"verified_fuzzy":20},"total_outbound_references":40},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 40 of 40 outbound references and 1 inbound Pith citation observation for arXiv:2505.13338."}