{"as_of":"2026-08-09T04:53:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:765fd61a8dbe6fede54b019f032ea8f9271dd8b35a129a80a5dec6711941659e","coverage":[{"denominator":42,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":42,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T20:01:29.438826Z","state":"measured"},{"denominator":44,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":44,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T20:01:29.331354Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-13T01:07:00.272497Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.04048","last_updated":"2025-07-05T14:16:06Z","snapshot_observed_at":"2026-08-06T19:54:26.714625Z","submitted_at":"2025-07-05T14:16:06Z","title":"CLEP-DG: Contrastive Learning for Speech Emotion Domain Generalization via Soft Prompt Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.04048","snapshot_observed_at":"2026-08-06T20:01:29.331354Z","title":"Large-scale pretrained mod- els like Whisper [14], WavLM [15], and HuBERT [16] en- hance SER robustness by leveraging extensive speech data","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.04048","last_updated":"2025-07-05T14:16:06Z","snapshot_observed_at":"2026-08-06T19:54:26.714625Z","submitted_at":"2025-07-05T14:16:06Z","title":"CLEP-DG: Contrastive Learning for Speech Emotion Domain Generalization via Soft Prompt Tuning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:29.331354Z"},"links":{"cited_paper":"/paper/2507.04048","citing_paper":"/paper/2507.04048"},"observation_digest":"sha256:f4ac4a1117b9b06155c2f5e7e46a2fcb131dc2570e255f3da048ec2c966d2234","observation_id":"ad2f2715-09be-4f1c-89e4-ceed8bf8eea9","resolution":{"observed_at":"2026-08-06T20:01:29.331354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.04048","last_updated":"2025-07-05T14:16:06Z","snapshot_observed_at":"2026-08-06T19:54:26.714625Z","submitted_at":"2025-07-05T14:16:06Z","title":"CLEP-DG: Contrastive Learning for Speech Emotion Domain Generalization via Soft Prompt Tuning","version":1},"cited_work":{"arxiv_id":"2507.04048","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.04048","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2507.04048 , year=","venue":null,"work_id":"db2357a9-62e0-45ad-9878-a93ae3d0f753","year":null},"citing_paper":{"arxiv_id":"2605.11098","last_updated":"2026-05-11T18:04:33Z","snapshot_observed_at":"2026-07-06T23:22:57.012338Z","submitted_at":"2026-05-11T18:04:33Z","title":"AffectCodec: Emotion-Preserving Neural Speech Codec for Expressive Speech Modeling","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-05-13T01:04:54.506749Z"},"links":{"cited_paper":"/paper/2507.04048","citing_paper":"/paper/2605.11098"},"observation_digest":"sha256:f95f2411211092ca56fe2b28f66415929117b07b999187c8711559e172618ef2","observation_id":"9226301f-dbc6-4bb4-a138-ba43f41028d8","resolution":{"observed_at":"2026-05-13T01:07:00.273850Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.04048/citation-record","integrity":"/paper/2507.04048/integrity","json":"/paper/2507.04048/citation-record.json","paper":"/paper/2507.04048"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:01:29.773892Z","title":"this is a sound of","venue":null,"work_id":"53a109ec-5be7-4dac-bfe7-0abb0a919902","year":null},"citing_paper":{"arxiv_id":"2507.04048","last_updated":"2025-07-05T14:16:06Z","snapshot_observed_at":"2026-08-06T19:54:26.714625Z","submitted_at":"2025-07-05T14:16:06Z","title":"CLEP-DG: Contrastive Learning for Speech Emotion Domain Generalization via Soft Prompt Tuning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:29.327598Z"},"links":{"citing_paper":"/paper/2507.04048"},"observation_digest":"sha256:ce123eec584d5027551f93fc574f092d21dbc023e079cff25246f02fcc8ba2a8","observation_id":"92b8aeb1-c476-4ab4-a49c-c1763b421afb","resolution":{"observed_at":"2026-08-06T20:01:29.777066Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.04048","last_updated":"2025-07-05T14:16:06Z","snapshot_observed_at":"2026-08-06T19:54:26.714625Z","submitted_at":"2025-07-05T14:16:06Z","title":"CLEP-DG: Contrastive Learning for Speech Emotion Domain Generalization via Soft Prompt Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.04048","snapshot_observed_at":"2026-08-06T20:01:29.331354Z","title":"Large-scale pretrained mod- els like Whisper [14], WavLM [15], and HuBERT [16] en- hance SER robustness by leveraging extensive speech data","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.04048","last_updated":"2025-07-05T14:16:06Z","snapshot_observed_at":"2026-08-06T19:54:26.714625Z","submitted_at":"2025-07-05T14:16:06Z","title":"CLEP-DG: Contrastive Learning for Speech Emotion Domain Generalization via Soft Prompt Tuning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:29.331354Z"},"links":{"cited_paper":"/paper/2507.04048","citing_paper":"/paper/2507.04048"},"observation_digest":"sha256:f4ac4a1117b9b06155c2f5e7e46a2fcb131dc2570e255f3da048ec2c966d2234","observation_id":"ad2f2715-09be-4f1c-89e4-ceed8bf8eea9","resolution":{"observed_at":"2026-08-06T20:01:29.331354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:01:29.765174Z","title":"Happy” or “Sad","venue":null,"work_id":"0540bf1e-490e-4aef-b495-be1c686f8586","year":null},"citing_paper":{"arxiv_id":"2507.04048","last_updated":"2025-07-05T14:16:06Z","snapshot_observed_at":"2026-08-06T19:54:26.714625Z","submitted_at":"2025-07-05T14:16:06Z","title":"CLEP-DG: Contrastive Learning for Speech Emotion Domain Generalization via Soft Prompt Tuning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:29.334984Z"},"links":{"citing_paper":"/paper/2507.04048"},"observation_digest":"sha256:ad31b0f894415a39c1a63a393405183aaa0e87031adb02541706ce783d84540d","observation_id":"79d52062-635a-4fc2-8219-aea16cf4813c","resolution":{"observed_at":"2026-08-06T20:01:29.768125Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:01:29.757188Z","title":"excited” and “happy","venue":null,"work_id":"f45620bf-282d-4dfc-bb5a-5f76f80baa2a","year":null},"citing_paper":{"arxiv_id":"2507.04048","last_updated":"2025-07-05T14:16:06Z","snapshot_observed_at":"2026-08-06T19:54:26.714625Z","submitted_at":"2025-07-05T14:16:06Z","title":"CLEP-DG: Contrastive Learning for Speech Emotion Domain Generalization via Soft Prompt Tuning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:29.338492Z"},"links":{"citing_paper":"/paper/2507.04048"},"observation_digest":"sha256:9e25905c86a965f31abcb80298560fa7347df061d9ecfa1097068ae1e645816e","observation_id":"670fde26-2dd7-438f-99dc-9ffda49bd000","resolution":{"observed_at":"2026-08-06T20:01:29.759674Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:01:29.749087Z","title":"Integrating Acoustic Context Prompt Tuning (ACPT), CLEP-DG improves general- ization across diverse acoustic environments without additional labeled speech data","venue":null,"work_id":"9a245c0e-0d65-4cb4-a5bc-5533b43282a9","year":null},"citing_paper":{"arxiv_id":"2507.04048","last_updated":"2025-07-05T14:16:06Z","snapshot_observed_at":"2026-08-06T19:54:26.714625Z","submitted_at":"2025-07-05T14:16:06Z","title":"CLEP-DG: Contrastive Learning for Speech Emotion Domain Generalization via Soft Prompt Tuning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:29.341488Z"},"links":{"citing_paper":"/paper/2507.04048"},"observation_digest":"sha256:61a430143a7a075ea3620ed309e1da9f1d0047b457d9873abe5fc8152e9f376c","observation_id":"9b8f5ce6-b8e1-4eca-8a2c-603583d0ac75","resolution":{"observed_at":"2026-08-06T20:01:29.751978Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:01:29.741403Z","title":"Affective computing: A review,","venue":null,"work_id":"93194f35-46b2-466d-bdd8-e7645d37caa3","year":2005},"citing_paper":{"arxiv_id":"2507.04048","last_updated":"2025-07-05T14:16:06Z","snapshot_observed_at":"2026-08-06T19:54:26.714625Z","submitted_at":"2025-07-05T14:16:06Z","title":"CLEP-DG: Contrastive Learning for Speech Emotion Domain Generalization via Soft Prompt Tuning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:29.344546Z"},"links":{"citing_paper":"/paper/2507.04048"},"observation_digest":"sha256:dc3b7e657ab19ad90227275cbcfb324d4c7a9430834dc84d0f51e7d3fafdf8fe","observation_id":"8c4ede18-eee3-4a24-a63f-310a23eb363b","resolution":{"observed_at":"2026-08-06T20:01:29.744069Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:01:29.733541Z","title":"Preece, Y","venue":null,"work_id":"4569ccfb-46fe-4e7b-9f02-2716a9ed3f55","year":1994},"citing_paper":{"arxiv_id":"2507.04048","last_updated":"2025-07-05T14:16:06Z","snapshot_observed_at":"2026-08-06T19:54:26.714625Z","submitted_at":"2025-07-05T14:16:06Z","title":"CLEP-DG: Contrastive Learning for Speech Emotion Domain Generalization via Soft Prompt Tuning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:29.347248Z"},"links":{"citing_paper":"/paper/2507.04048"},"observation_digest":"sha256:be51c63bce901de5f4bbb48593d6af82eff049d2c8fb8ef4c2ed34f5d7b94910","observation_id":"99d1de42-a775-4ee7-ab23-3589916be9f4","resolution":{"observed_at":"2026-08-06T20:01:29.736494Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:01:29.349695Z","title":"Clap learning audio concepts from natural language supervision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.04048","last_updated":"2025-07-05T14:16:06Z","snapshot_observed_at":"2026-08-06T19:54:26.714625Z","submitted_at":"2025-07-05T14:16:06Z","title":"CLEP-DG: Contrastive Learning for Speech Emotion Domain Generalization via Soft Prompt Tuning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:29.349695Z"},"links":{"citing_paper":"/paper/2507.04048"},"observation_digest":"sha256:73a573a6a05f9db52fcf23e48f9d40666e2fe2624db744019e851ab774715914","observation_id":"f8212573-553b-4109-88da-8f8b7a38ef16","resolution":{"observed_at":"2026-08-06T20:01:29.349695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:01:29.352747Z","title":"Large-scale contrastive language-audio pretraining with feature fusion and keyword-to-caption augmentation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.04048","last_updated":"2025-07-05T14:16:06Z","snapshot_observed_at":"2026-08-06T19:54:26.714625Z","submitted_at":"2025-07-05T14:16:06Z","title":"CLEP-DG: Contrastive Learning for Speech Emotion Domain Generalization via Soft Prompt Tuning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:29.352747Z"},"links":{"citing_paper":"/paper/2507.04048"},"observation_digest":"sha256:5b1360fe8ae541abefc478157583ef3a8aa145864e1afe791958a53758866de9","observation_id":"370f554c-f3d9-4e8c-95ce-f3c59a0f963c","resolution":{"observed_at":"2026-08-06T20:01:29.352747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07203","last_updated":"2024-06-11T12:23:01Z","snapshot_observed_at":"2026-07-06T18:28:51.180903Z","submitted_at":"2024-06-11T12:23:01Z","title":"ParaCLAP -- Towards a general language-audio model for computational paralinguistic tasks","version":1},"cited_work":{"arxiv_id":"2406.07203","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.07203","snapshot_observed_at":"2026-08-06T20:01:29.515425Z","title":"ParaCLAP -- Towards a general language-audio model for computational paralinguistic tasks","venue":"cs.SD","work_id":"e33108d7-ce81-44d9-9e2d-7d546b719b8e","year":2024},"citing_paper":{"arxiv_id":"2507.04048","last_updated":"2025-07-05T14:16:06Z","snapshot_observed_at":"2026-08-06T19:54:26.714625Z","submitted_at":"2025-07-05T14:16:06Z","title":"CLEP-DG: Contrastive Learning for Speech Emotion Domain Generalization via Soft Prompt Tuning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:29.355551Z"},"links":{"cited_paper":"/paper/2406.07203","citing_paper":"/paper/2507.04048"},"observation_digest":"sha256:ef977e9cfdf9e76ac271b79fbfe88f0e5553695e39f72b6b7ad96e663dbb2257","observation_id":"94dcbb3d-0e1a-4fbb-ab3a-f09af57abd36","resolution":{"observed_at":"2026-08-06T20:01:29.518461Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07848","last_updated":"2023-12-04T06:27:50Z","snapshot_observed_at":"2026-07-06T15:42:06.758676Z","submitted_at":"2023-06-13T15:28:10Z","title":"GEmo-CLAP: Gender-Attribute-Enhanced Contrastive Language-Audio Pretraining for Accurate Speech Emotion Recognition","version":10},"cited_work":{"arxiv_id":"2306.07848","doi":null,"metadata_source":"pith","pith_arxiv_id":"2306.07848","snapshot_observed_at":"2026-08-06T20:01:29.502574Z","title":"GEmo-CLAP: Gender-Attribute-Enhanced Contrastive Language-Audio Pretraining for Accurate Speech Emotion Recognition","venue":"cs.CL","work_id":"0131d469-3898-4f0b-9753-4f8801513747","year":2023},"citing_paper":{"arxiv_id":"2507.04048","last_updated":"2025-07-05T14:16:06Z","snapshot_observed_at":"2026-08-06T19:54:26.714625Z","submitted_at":"2025-07-05T14:16:06Z","title":"CLEP-DG: Contrastive Learning for Speech Emotion Domain Generalization via Soft Prompt Tuning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:29.358691Z"},"links":{"cited_paper":"/paper/2306.07848","citing_paper":"/paper/2507.04048"},"observation_digest":"sha256:c6e98ae558b6bdb1b525edd90bfa13ac5e4cc82da218564ec8d30ea564befda7","observation_id":"4cba598e-f394-4aaa-b568-172460786805","resolution":{"observed_at":"2026-08-06T20:01:29.507173Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:01:29.716435Z","title":"Cross-modal features interaction-and-aggregation network with self-consistency train- ing for speech emotion recognition,","venue":null,"work_id":"a2519afa-5275-49d8-abf5-1367c7092613","year":2024},"citing_paper":{"arxiv_id":"2507.04048","last_updated":"2025-07-05T14:16:06Z","snapshot_observed_at":"2026-08-06T19:54:26.714625Z","submitted_at":"2025-07-05T14:16:06Z","title":"CLEP-DG: Contrastive Learning for Speech Emotion Domain Generalization via Soft Prompt Tuning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:29.361954Z"},"links":{"citing_paper":"/paper/2507.04048"},"observation_digest":"sha256:e1897cfcfbb81d22fed9f16b777bc1536b51a37ed22a102e7a28b20bcf87588d","observation_id":"dfa20ce6-0dce-4dfa-9608-140020328e92","resolution":{"observed_at":"2026-08-06T20:01:29.719068Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:01:29.708682Z","title":"Conditional prompt learning for vision-language models,","venue":null,"work_id":"adef35d8-e6d0-48d5-8fdb-5ec23a85e929","year":2022},"citing_paper":{"arxiv_id":"2507.04048","last_updated":"2025-07-05T14:16:06Z","snapshot_observed_at":"2026-08-06T19:54:26.714625Z","submitted_at":"2025-07-05T14:16:06Z","title":"CLEP-DG: Contrastive Learning for Speech Emotion Domain Generalization via Soft Prompt Tuning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:29.364310Z"},"links":{"citing_paper":"/paper/2507.04048"},"observation_digest":"sha256:c7e6d4d6ca8d954be4537a0a9d26738a6544093accca4c7a530418503415644f","observation_id":"7797ec94-1d13-421d-a9c2-632b61bfbf16","resolution":{"observed_at":"2026-08-06T20:01:29.711360Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:01:29.700835Z","title":"Learning to prompt for vision-language models,","venue":null,"work_id":"0ad91933-92de-4d58-9dad-ab9ef355d75b","year":2022},"citing_paper":{"arxiv_id":"2507.04048","last_updated":"2025-07-05T14:16:06Z","snapshot_observed_at":"2026-08-06T19:54:26.714625Z","submitted_at":"2025-07-05T14:16:06Z","title":"CLEP-DG: Contrastive Learning for Speech Emotion Domain Generalization via Soft Prompt Tuning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:29.367220Z"},"links":{"citing_paper":"/paper/2507.04048"},"observation_digest":"sha256:5c9e89b5652f193b70a7ea3f7ae4a707aea600dbece0c5ab303d0cecff930d90","observation_id":"2ce0f5f2-f8ce-4c16-95f4-35219796bc82","resolution":{"observed_at":"2026-08-06T20:01:29.703426Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.04269","last_updated":"2023-02-08T18:59:42Z","snapshot_observed_at":"2026-07-06T14:49:48.724079Z","submitted_at":"2023-02-08T18:59:42Z","title":"Diagnosing and Rectifying Vision Models using Language","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.04269","snapshot_observed_at":"2026-08-06T20:01:29.369990Z","title":"Diagnosing and rectifying vision models using lan- guage,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.04048","last_updated":"2025-07-05T14:16:06Z","snapshot_observed_at":"2026-08-06T19:54:26.714625Z","submitted_at":"2025-07-05T14:16:06Z","title":"CLEP-DG: Contrastive Learning for Speech Emotion Domain Generalization via Soft Prompt Tuning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:29.369990Z"},"links":{"cited_paper":"/paper/2302.04269","citing_paper":"/paper/2507.04048"},"observation_digest":"sha256:698f826b673fa110dea056dc1a0c0f48dd3b98242488f0760d492451486ba89a","observation_id":"b888d2f4-3420-418e-990a-d53cfaca40a6","resolution":{"observed_at":"2026-08-06T20:01:29.369990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:01:29.693308Z","title":"Using language to ex- tend to unseen domains","venue":null,"work_id":"8edc20c7-bc2c-4435-a703-b979b7d6aa22","year":2023},"citing_paper":{"arxiv_id":"2507.04048","last_updated":"2025-07-05T14:16:06Z","snapshot_observed_at":"2026-08-06T19:54:26.714625Z","submitted_at":"2025-07-05T14:16:06Z","title":"CLEP-DG: Contrastive Learning for Speech Emotion Domain Generalization via Soft Prompt Tuning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:29.372739Z"},"links":{"citing_paper":"/paper/2507.04048"},"observation_digest":"sha256:4901f50c3fdc71ebfd76a45dfcd02c722eb235b60625628798e7460166e8e91b","observation_id":"c28a94be-cb91-447c-9971-1e4bccd0005e","resolution":{"observed_at":"2026-08-06T20:01:29.695918Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:01:29.685753Z","title":"Promptstyler: Prompt-driven style generation for source-free domain generaliza- tion,","venue":null,"work_id":"f8442f47-f5fa-47d1-a452-48fd0991dfe9","year":2023},"citing_paper":{"arxiv_id":"2507.04048","last_updated":"2025-07-05T14:16:06Z","snapshot_observed_at":"2026-08-06T19:54:26.714625Z","submitted_at":"2025-07-05T14:16:06Z","title":"CLEP-DG: Contrastive Learning for Speech Emotion Domain Generalization via Soft Prompt Tuning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:29.375131Z"},"links":{"citing_paper":"/paper/2507.04048"},"observation_digest":"sha256:15dbf2e8f6ee6e53d0d551208585580a42ba233bfd5020ecbb287edf33335fa6","observation_id":"64e1a4bd-0bca-4c0e-b7af-3d4419df860d","resolution":{"observed_at":"2026-08-06T20:01:29.688417Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:01:29.677468Z","title":"Dpstyler: dynamic prompt- styler for source-free domain generalization,","venue":null,"work_id":"394115b2-8f5e-4d7b-950e-e3e961213e5c","year":2025},"citing_paper":{"arxiv_id":"2507.04048","last_updated":"2025-07-05T14:16:06Z","snapshot_observed_at":"2026-08-06T19:54:26.714625Z","submitted_at":"2025-07-05T14:16:06Z","title":"CLEP-DG: Contrastive Learning for Speech Emotion Domain Generalization via Soft Prompt Tuning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:29.377373Z"},"links":{"citing_paper":"/paper/2507.04048"},"observation_digest":"sha256:1b6f2826b3accf21399650fc90a4e7a461f1bc9c2eef1f0b02042837ce7ca155","observation_id":"dff51774-32af-4eae-bbd5-54d657626344","resolution":{"observed_at":"2026-08-06T20:01:29.680801Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:01:29.669854Z","title":"Whisper: Robust speech recognition via large-scale weak supervision,","venue":null,"work_id":"b8e21cb1-5661-413c-9984-fe7d99cd54fd","year":2022},"citing_paper":{"arxiv_id":"2507.04048","last_updated":"2025-07-05T14:16:06Z","snapshot_observed_at":"2026-08-06T19:54:26.714625Z","submitted_at":"2025-07-05T14:16:06Z","title":"CLEP-DG: Contrastive Learning for Speech Emotion Domain Generalization via Soft Prompt Tuning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:29.380093Z"},"links":{"citing_paper":"/paper/2507.04048"},"observation_digest":"sha256:9ba3a7b400858d9dd364ee30f2dd8b53fec1251a501a3f2c6d641355d5ee1c4c","observation_id":"8816ffcc-4c9a-4caa-8900-cebb04616ce6","resolution":{"observed_at":"2026-08-06T20:01:29.672462Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:01:29.382456Z","title":"Wavlm: Large-scale self- supervised pre-training for full stack speech processing,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.04048","last_updated":"2025-07-05T14:16:06Z","snapshot_observed_at":"2026-08-06T19:54:26.714625Z","submitted_at":"2025-07-05T14:16:06Z","title":"CLEP-DG: Contrastive Learning for Speech Emotion Domain Generalization via Soft Prompt Tuning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:29.382456Z"},"links":{"citing_paper":"/paper/2507.04048"},"observation_digest":"sha256:c4f94d0dab2c58cfcafeb05011cc9421dbfc2f5237907abc5bed74fd892f313c","observation_id":"8fb4169a-d501-497a-b5f9-9597b10410fd","resolution":{"observed_at":"2026-08-06T20:01:29.382456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:01:29.384916Z","title":"Hubert: Self-supervised speech represen- tation learning by masked prediction of hidden units,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.04048","last_updated":"2025-07-05T14:16:06Z","snapshot_observed_at":"2026-08-06T19:54:26.714625Z","submitted_at":"2025-07-05T14:16:06Z","title":"CLEP-DG: Contrastive Learning for Speech Emotion Domain Generalization via Soft Prompt Tuning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:29.384916Z"},"links":{"citing_paper":"/paper/2507.04048"},"observation_digest":"sha256:03ff88f4fa90fdbe62b275e474eb54af8a33b4657aa22b0ba4b1973e9157453b","observation_id":"70ad7e6a-9751-4580-a8ab-441ee5be647c","resolution":{"observed_at":"2026-08-06T20:01:29.384916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:01:29.653251Z","title":"Wav2clip: Learning robust audio representations via contrastive learning,","venue":null,"work_id":"f0d6109f-48b3-457b-87aa-9336a9dcea12","year":2023},"citing_paper":{"arxiv_id":"2507.04048","last_updated":"2025-07-05T14:16:06Z","snapshot_observed_at":"2026-08-06T19:54:26.714625Z","submitted_at":"2025-07-05T14:16:06Z","title":"CLEP-DG: Contrastive Learning for Speech Emotion Domain Generalization via Soft Prompt Tuning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:29.387390Z"},"links":{"citing_paper":"/paper/2507.04048"},"observation_digest":"sha256:1da89286d4527595f999ad5cd8570d5b4126c62bb610449ccf02533e3d2c66de","observation_id":"01573aa2-c727-433e-883e-63f65e8768f0","resolution":{"observed_at":"2026-08-06T20:01:29.655603Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:01:29.646292Z","title":"Audioclip: Ex- tending clip to audio for zero-shot learning,","venue":null,"work_id":"3211b18c-b3ee-44ba-8f57-f0d00ef0a6ab","year":2023},"citing_paper":{"arxiv_id":"2507.04048","last_updated":"2025-07-05T14:16:06Z","snapshot_observed_at":"2026-08-06T19:54:26.714625Z","submitted_at":"2025-07-05T14:16:06Z","title":"CLEP-DG: Contrastive Learning for Speech Emotion Domain Generalization via Soft Prompt Tuning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:29.390000Z"},"links":{"citing_paper":"/paper/2507.04048"},"observation_digest":"sha256:771abbf6ab8589467ea402570456ca53ef4997072063c013a856f6bdbda977e6","observation_id":"2625ad7b-fcfd-4752-9299-1440e23b9889","resolution":{"observed_at":"2026-08-06T20:01:29.648806Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:01:29.639261Z","title":"Compa-clap: Composi- tional prompts for improving audio-text alignment,","venue":null,"work_id":"3524e384-b33e-4b77-a492-11ffd3a08582","year":2024},"citing_paper":{"arxiv_id":"2507.04048","last_updated":"2025-07-05T14:16:06Z","snapshot_observed_at":"2026-08-06T19:54:26.714625Z","submitted_at":"2025-07-05T14:16:06Z","title":"CLEP-DG: Contrastive Learning for Speech Emotion Domain Generalization via Soft Prompt Tuning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:29.392561Z"},"links":{"citing_paper":"/paper/2507.04048"},"observation_digest":"sha256:1c28b3cac5e606bf438380619c64928cb756df512a00b723f40006d1a4cf45f5","observation_id":"91557793-16a5-440d-985b-1a8294ce4506","resolution":{"observed_at":"2026-08-06T20:01:29.641902Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1312.4894","last_updated":"2014-04-14T19:21:13Z","snapshot_observed_at":"2026-07-06T03:31:09.551860Z","submitted_at":"2013-12-17T19:00:50Z","title":"Deep Convolutional Ranking for Multilabel Image Annotation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.4894","snapshot_observed_at":"2026-08-06T20:01:29.395015Z","title":"Deep convo- lutional ranking for multilabel image annotation,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2507.04048","last_updated":"2025-07-05T14:16:06Z","snapshot_observed_at":"2026-08-06T19:54:26.714625Z","submitted_at":"2025-07-05T14:16:06Z","title":"CLEP-DG: Contrastive Learning for Speech Emotion Domain Generalization via Soft Prompt Tuning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:29.395015Z"},"links":{"cited_paper":"/paper/1312.4894","citing_paper":"/paper/2507.04048"},"observation_digest":"sha256:0d6a9d856b1f1b7072f4bf2a81ec1929b033238c68038c8996db535a0f8e5483","observation_id":"cc81ca27-3f19-46a3-b1bd-790c4c42a003","resolution":{"observed_at":"2026-08-06T20:01:29.395015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:01:29.631247Z","title":"Arcface: Additive angular margin loss for deep face recognition,","venue":null,"work_id":"56d563a5-da11-4109-917f-5018ea1cc20d","year":2019},"citing_paper":{"arxiv_id":"2507.04048","last_updated":"2025-07-05T14:16:06Z","snapshot_observed_at":"2026-08-06T19:54:26.714625Z","submitted_at":"2025-07-05T14:16:06Z","title":"CLEP-DG: Contrastive Learning for Speech Emotion Domain Generalization via Soft Prompt Tuning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:29.397824Z"},"links":{"citing_paper":"/paper/2507.04048"},"observation_digest":"sha256:d9f2aa7a2f0e8bcc073fbd199fc04fdbac80ed62e73b4531978793350e716cb2","observation_id":"aa93ad76-4c87-46f2-9331-c24d3baab56a","resolution":{"observed_at":"2026-08-06T20:01:29.634308Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:01:29.623698Z","title":"IEMOCAP: In- teractive emotional dyadic motion capture database,","venue":null,"work_id":"7bd5b58c-e4ba-4bdd-8a43-400961e02f8d","year":2008},"citing_paper":{"arxiv_id":"2507.04048","last_updated":"2025-07-05T14:16:06Z","snapshot_observed_at":"2026-08-06T19:54:26.714625Z","submitted_at":"2025-07-05T14:16:06Z","title":"CLEP-DG: Contrastive Learning for Speech Emotion Domain Generalization via Soft Prompt Tuning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:29.400110Z"},"links":{"citing_paper":"/paper/2507.04048"},"observation_digest":"sha256:4e4fbb6c60a49bc7f98aa7be512127cc45896772ab731f27882cf487c0f58d03","observation_id":"d08ccacf-c164-47bd-98c7-9b4f6ed5406b","resolution":{"observed_at":"2026-08-06T20:01:29.626550Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:01:29.615783Z","title":"MELD: A Multimodal Multi-Party Dataset for Emotion Recognition in Conversations,","venue":null,"work_id":"64df34ce-0251-4b54-87cf-05db76d3357b","year":2019},"citing_paper":{"arxiv_id":"2507.04048","last_updated":"2025-07-05T14:16:06Z","snapshot_observed_at":"2026-08-06T19:54:26.714625Z","submitted_at":"2025-07-05T14:16:06Z","title":"CLEP-DG: Contrastive Learning for Speech Emotion Domain Generalization via Soft Prompt Tuning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:29.402579Z"},"links":{"citing_paper":"/paper/2507.04048"},"observation_digest":"sha256:634808c776c7cdebb7163ae21c2ec766809c1341785f4a219be7ce6a1a2d9bbe","observation_id":"055f513e-b28d-43f8-a98a-adbf5f065974","resolution":{"observed_at":"2026-08-06T20:01:29.618864Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:01:29.608223Z","title":"MEAD: A Large-Scale Audio-Visual Dataset for Affective Un- derstanding and Emotional Expression Analysis,","venue":null,"work_id":"7e68cb92-7e96-4ed8-89a3-63b91e7ebfce","year":2020},"citing_paper":{"arxiv_id":"2507.04048","last_updated":"2025-07-05T14:16:06Z","snapshot_observed_at":"2026-08-06T19:54:26.714625Z","submitted_at":"2025-07-05T14:16:06Z","title":"CLEP-DG: Contrastive Learning for Speech Emotion Domain Generalization via Soft Prompt Tuning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:29.405056Z"},"links":{"citing_paper":"/paper/2507.04048"},"observation_digest":"sha256:adf33140876306fa2ecb9794af0d49f87027cf60161fa00171ee77974b5761f5","observation_id":"b6872e72-4806-4a77-8d43-e4957be45e4e","resolution":{"observed_at":"2026-08-06T20:01:29.611138Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:01:29.600788Z","title":"CMU-MOSEI: A Dataset for Multimodal Sentiment Analysis and Emotion Recognition,","venue":null,"work_id":"c461d94e-10fe-4b7c-81fe-aa055e5a3fc7","year":2018},"citing_paper":{"arxiv_id":"2507.04048","last_updated":"2025-07-05T14:16:06Z","snapshot_observed_at":"2026-08-06T19:54:26.714625Z","submitted_at":"2025-07-05T14:16:06Z","title":"CLEP-DG: Contrastive Learning for Speech Emotion Domain Generalization via Soft Prompt Tuning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:29.407680Z"},"links":{"citing_paper":"/paper/2507.04048"},"observation_digest":"sha256:b1e5dc9bcb7a641cb582d718c896efa7be8fe2c5ff11a303f7e808b6696842de","observation_id":"3d296c53-f88e-4c98-ac46-035dbca314f6","resolution":{"observed_at":"2026-08-06T20:01:29.603415Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:01:29.592980Z","title":"Wav2clip: Learning robust audio representations from clip,","venue":null,"work_id":"eef3518c-617f-434a-b369-bd3231d11a6b","year":2022},"citing_paper":{"arxiv_id":"2507.04048","last_updated":"2025-07-05T14:16:06Z","snapshot_observed_at":"2026-08-06T19:54:26.714625Z","submitted_at":"2025-07-05T14:16:06Z","title":"CLEP-DG: Contrastive Learning for Speech Emotion Domain Generalization via Soft Prompt Tuning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:29.410016Z"},"links":{"citing_paper":"/paper/2507.04048"},"observation_digest":"sha256:d1ef233b09314bf2b8bad73eaba56b7a3cd43c993f6998b2ab354cd237edec80","observation_id":"d0869239-af0e-4643-b230-96a001f5cd9f","resolution":{"observed_at":"2026-08-06T20:01:29.595828Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.13043","last_updated":"2021-06-24T14:16:38Z","snapshot_observed_at":"2026-08-04T12:48:20.635692Z","submitted_at":"2021-06-24T14:16:38Z","title":"AudioCLIP: Extending CLIP to Image, Text and Audio","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.13043","snapshot_observed_at":"2026-08-06T20:01:29.412385Z","title":"Audioclip: Extending clip to image, text and audio,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.04048","last_updated":"2025-07-05T14:16:06Z","snapshot_observed_at":"2026-08-06T19:54:26.714625Z","submitted_at":"2025-07-05T14:16:06Z","title":"CLEP-DG: Contrastive Learning for Speech Emotion Domain Generalization via Soft Prompt Tuning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:29.412385Z"},"links":{"cited_paper":"/paper/2106.13043","citing_paper":"/paper/2507.04048"},"observation_digest":"sha256:5ed5bf739571c26913da3fe48a1627afa8e5b077fcc1fdbf5a6eef6df8e43d45","observation_id":"3a01696e-7f0d-4ddf-99fb-bd60b513d358","resolution":{"observed_at":"2026-08-06T20:01:29.412385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08753","last_updated":"2024-07-30T18:58:01Z","snapshot_observed_at":"2026-08-07T21:08:58.215902Z","submitted_at":"2023-10-12T22:43:38Z","title":"CompA: Addressing the Gap in Compositional Reasoning in Audio-Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08753","snapshot_observed_at":"2026-08-06T20:01:29.415153Z","title":"Compa: Addressing the gap in composi- tional reasoning in audio-language models,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.04048","last_updated":"2025-07-05T14:16:06Z","snapshot_observed_at":"2026-08-06T19:54:26.714625Z","submitted_at":"2025-07-05T14:16:06Z","title":"CLEP-DG: Contrastive Learning for Speech Emotion Domain Generalization via Soft Prompt Tuning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:29.415153Z"},"links":{"cited_paper":"/paper/2310.08753","citing_paper":"/paper/2507.04048"},"observation_digest":"sha256:db98b376a28826cef5eb6084f2a47047545e073bbf293605374d013a0a709ee5","observation_id":"ca24a637-25ba-4b48-aaa4-e835a7fa2ce1","resolution":{"observed_at":"2026-08-06T20:01:29.415153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:01:29.585071Z","title":"The Ryerson Audio-Visual Database of Emotional Speech and Song (RA VDESS),","venue":null,"work_id":"74e32976-9fee-4a5d-a629-903f0676d062","year":2018},"citing_paper":{"arxiv_id":"2507.04048","last_updated":"2025-07-05T14:16:06Z","snapshot_observed_at":"2026-08-06T19:54:26.714625Z","submitted_at":"2025-07-05T14:16:06Z","title":"CLEP-DG: Contrastive Learning for Speech Emotion Domain Generalization via Soft Prompt Tuning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:29.418479Z"},"links":{"citing_paper":"/paper/2507.04048"},"observation_digest":"sha256:36a8831981c555d6f1ef23b90b6a752b8caf7d0fc295070be5d4f30279a04a09","observation_id":"770b239e-4e4b-4de8-91cf-9a3cc21ec562","resolution":{"observed_at":"2026-08-06T20:01:29.587583Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:01:29.577576Z","title":"Toronto emotional speech set (tess)-younger talker happy,","venue":null,"work_id":"dea89c33-6606-43b6-96d3-4173b852a7c3","year":2010},"citing_paper":{"arxiv_id":"2507.04048","last_updated":"2025-07-05T14:16:06Z","snapshot_observed_at":"2026-08-06T19:54:26.714625Z","submitted_at":"2025-07-05T14:16:06Z","title":"CLEP-DG: Contrastive Learning for Speech Emotion Domain Generalization via Soft Prompt Tuning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:29.420933Z"},"links":{"citing_paper":"/paper/2507.04048"},"observation_digest":"sha256:ef078b0e1c4faa86dbe6b4ecdc9014dcbdb6d700902bdb2823d5fcac39c602c4","observation_id":"55cbc3c2-9c45-482e-8f43-e23149d54465","resolution":{"observed_at":"2026-08-06T20:01:29.580223Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:01:29.569956Z","title":"SA VEE: Surrey Audio-Visual Expressed Emotion,","venue":null,"work_id":"58a6699e-e8d5-42be-b69e-22641f1e5ec0","year":2014},"citing_paper":{"arxiv_id":"2507.04048","last_updated":"2025-07-05T14:16:06Z","snapshot_observed_at":"2026-08-06T19:54:26.714625Z","submitted_at":"2025-07-05T14:16:06Z","title":"CLEP-DG: Contrastive Learning for Speech Emotion Domain Generalization via Soft Prompt Tuning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:29.423438Z"},"links":{"citing_paper":"/paper/2507.04048"},"observation_digest":"sha256:7c10a6cc212368bb6ffcfef854e90a59213a7d1c5d04896017fa9d5464c3077f","observation_id":"b01a99ee-2eac-4821-b6cc-aa66c965a4e4","resolution":{"observed_at":"2026-08-06T20:01:29.572715Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:01:29.562292Z","title":"DST: Deformable Speech Transformer for Emotion Recognition,","venue":null,"work_id":"6f258115-3073-4b02-b43f-a501816491d2","year":2023},"citing_paper":{"arxiv_id":"2507.04048","last_updated":"2025-07-05T14:16:06Z","snapshot_observed_at":"2026-08-06T19:54:26.714625Z","submitted_at":"2025-07-05T14:16:06Z","title":"CLEP-DG: Contrastive Learning for Speech Emotion Domain Generalization via Soft Prompt Tuning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:29.426195Z"},"links":{"citing_paper":"/paper/2507.04048"},"observation_digest":"sha256:62abe5b0d842f138e707c1e51fe87ce0089f311d06f816a69ba832927c2a3a3a","observation_id":"75b1e647-c221-40d3-9a69-e280d3211535","resolution":{"observed_at":"2026-08-06T20:01:29.564895Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:01:29.553344Z","title":"Tem- poral modeling matters: A novel temporal emotional modeling approach,","venue":null,"work_id":"c61dbe80-40bb-4013-b023-22a55010c3fc","year":2023},"citing_paper":{"arxiv_id":"2507.04048","last_updated":"2025-07-05T14:16:06Z","snapshot_observed_at":"2026-08-06T19:54:26.714625Z","submitted_at":"2025-07-05T14:16:06Z","title":"CLEP-DG: Contrastive Learning for Speech Emotion Domain Generalization via Soft Prompt Tuning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:29.429206Z"},"links":{"citing_paper":"/paper/2507.04048"},"observation_digest":"sha256:4cf3cce6e323ff030bf2a2f6aa2ca0f1dc734ce963075c90f9cbfcf973bb6751","observation_id":"5f541385-8e8c-430e-b204-058de5de6653","resolution":{"observed_at":"2026-08-06T20:01:29.556456Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:01:29.431567Z","title":"The ryerson audio-visual database of emotional speech and song (ravdess): A dynamic, multimodal set of facial and vocal expressions in north american english,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.04048","last_updated":"2025-07-05T14:16:06Z","snapshot_observed_at":"2026-08-06T19:54:26.714625Z","submitted_at":"2025-07-05T14:16:06Z","title":"CLEP-DG: Contrastive Learning for Speech Emotion Domain Generalization via Soft Prompt Tuning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:29.431567Z"},"links":{"citing_paper":"/paper/2507.04048"},"observation_digest":"sha256:7e3c684a7b2239be9c4693d4c236113036fae618121bf19393e8d75cd3fcf9f4","observation_id":"c969f048-ef1b-4930-b924-17b2e368aec5","resolution":{"observed_at":"2026-08-06T20:01:29.431567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:01:29.540312Z","title":"Speaker-dependent audio- visual emotion recognition","venue":null,"work_id":"a0c7f31e-0ffe-4153-b7c0-59981e63fa3d","year":2009},"citing_paper":{"arxiv_id":"2507.04048","last_updated":"2025-07-05T14:16:06Z","snapshot_observed_at":"2026-08-06T19:54:26.714625Z","submitted_at":"2025-07-05T14:16:06Z","title":"CLEP-DG: Contrastive Learning for Speech Emotion Domain Generalization via Soft Prompt Tuning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:29.434143Z"},"links":{"citing_paper":"/paper/2507.04048"},"observation_digest":"sha256:5b7e3fcc73863467971199c560db5820036ad982ea523818ba1e1c1a52990489","observation_id":"129db151-23ea-4960-96d6-925a35c3d28f","resolution":{"observed_at":"2026-08-06T20:01:29.543120Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:01:29.531837Z","title":"Panns: Large-scale pretrained audio neural networks for audio pattern recognition,","venue":null,"work_id":"f45ecf25-13e2-4eb0-819f-a13e4c458697","year":2020},"citing_paper":{"arxiv_id":"2507.04048","last_updated":"2025-07-05T14:16:06Z","snapshot_observed_at":"2026-08-06T19:54:26.714625Z","submitted_at":"2025-07-05T14:16:06Z","title":"CLEP-DG: Contrastive Learning for Speech Emotion Domain Generalization via Soft Prompt Tuning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:29.436495Z"},"links":{"citing_paper":"/paper/2507.04048"},"observation_digest":"sha256:802619463450d1bf5816b6c370320cd0fd2744af49e8d70d9457a3d41545028f","observation_id":"4dd6b5c7-e19c-4e85-bd4a-1ff104e030e5","resolution":{"observed_at":"2026-08-06T20:01:29.535020Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1907.11692","last_updated":"2019-07-26T17:48:29Z","snapshot_observed_at":"2026-07-31T22:31:37.910868Z","submitted_at":"2019-07-26T17:48:29Z","title":"RoBERTa: A Robustly Optimized BERT Pretraining Approach","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.11692","snapshot_observed_at":"2026-08-06T20:01:29.438826Z","title":"Roberta: A robustly optimized bert pretraining ap- proach,","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2507.04048","last_updated":"2025-07-05T14:16:06Z","snapshot_observed_at":"2026-08-06T19:54:26.714625Z","submitted_at":"2025-07-05T14:16:06Z","title":"CLEP-DG: Contrastive Learning for Speech Emotion Domain Generalization via Soft Prompt Tuning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:29.438826Z"},"links":{"cited_paper":"/paper/1907.11692","citing_paper":"/paper/2507.04048"},"observation_digest":"sha256:37067f396b0acd35dbfa43f7dee5e0df52793b8eb438b36bfc7c9741096e1421","observation_id":"2d292fc6-b95e-4061-932f-ee7dd5174719","resolution":{"observed_at":"2026-08-06T20:01:29.438826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.04048","last_updated":"2025-07-05T14:16:06Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-06T19:54:26.714625Z","submitted_at":"2025-07-05T14:16:06Z","title":"CLEP-DG: Contrastive Learning for Speech Emotion Domain Generalization via Soft Prompt Tuning"},"reference_resolution":{"displayed":42,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":11,"verified_exact":2,"verified_fuzzy":29},"total_outbound_references":42},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 42 of 42 outbound references and 2 inbound Pith citation observations for arXiv:2507.04048."}