{"as_of":"2026-08-15T13:59:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ced793e8814c51c8a0ff558f1eb9711cc667b564f3d783dfaa2ce064a05ef3bc","coverage":[{"denominator":22,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":22,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T11:04:46.304755Z","state":"measured"},{"denominator":23,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":23,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-26T03:16:39.283647Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T14:39:57.486114Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2509.03292","last_updated":"2025-09-03T13:19:56Z","snapshot_observed_at":"2026-08-13T15:47:58.625184Z","submitted_at":"2025-09-03T13:19:56Z","title":"Improving Perceptual Audio Aesthetic Assessment via Triplet Loss and Self-Supervised Embeddings","version":1},"cited_work":{"arxiv_id":"2509.03292","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.03292","snapshot_observed_at":"2026-07-04T14:39:57.486114Z","title":"Improving perceptual audio aesthetic assessment via triplet loss and self-supervised embeddings,","venue":null,"work_id":"f0473862-44b3-4e02-8bcb-d6b59a79ee70","year":2025},"citing_paper":{"arxiv_id":"2606.26903","last_updated":"2026-06-25T11:35:12Z","snapshot_observed_at":"2026-08-09T03:19:55.751164Z","submitted_at":"2026-06-25T11:35:12Z","title":"DNSMOS-C: Improving End-to-end Speech Quality Models via Contrastive Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-26T03:16:39.283647Z"},"links":{"cited_paper":"/paper/2509.03292","citing_paper":"/paper/2606.26903"},"observation_digest":"sha256:705d592317971ec40295f2f9eafc5df4f2aec78d2c5604a29ba0902b968e13eb","observation_id":"5ed07b03-18c9-470d-8a5c-1519df88cac1","resolution":{"observed_at":"2026-07-04T14:39:57.487688Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2509.03292/citation-record","integrity":"/paper/2509.03292/integrity","json":"/paper/2509.03292/citation-record.json","paper":"/paper/2509.03292"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:04:49.914832Z","title":"The V oiceMOS Challenge 2022,","venue":null,"work_id":"4a1ca0d4-573f-49bd-8afa-ccaf740b8419","year":2022},"citing_paper":{"arxiv_id":"2509.03292","last_updated":"2025-09-03T13:19:56Z","snapshot_observed_at":"2026-08-13T15:47:58.625184Z","submitted_at":"2025-09-03T13:19:56Z","title":"Improving Perceptual Audio Aesthetic Assessment via Triplet Loss and Self-Supervised Embeddings","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T11:04:45.715077Z"},"links":{"citing_paper":"/paper/2509.03292"},"observation_digest":"sha256:74cad6f15d7adfd5c93416af916a4845c45c2649977b10352012808138c3ef8d","observation_id":"ef0f1f39-2be5-4036-8465-7526be8fa775","resolution":{"observed_at":"2026-08-05T11:04:49.956454Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:04:49.753111Z","title":"The voicemos challenge 2023: Zero-shot subjective speech quality prediction for multiple domains,","venue":null,"work_id":"86f1ac0f-1bca-4c45-8117-d8c07269a4cf","year":2023},"citing_paper":{"arxiv_id":"2509.03292","last_updated":"2025-09-03T13:19:56Z","snapshot_observed_at":"2026-08-13T15:47:58.625184Z","submitted_at":"2025-09-03T13:19:56Z","title":"Improving Perceptual Audio Aesthetic Assessment via Triplet Loss and Self-Supervised Embeddings","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T11:04:45.764757Z"},"links":{"citing_paper":"/paper/2509.03292"},"observation_digest":"sha256:2034189e050d5817e51d3059f6db35ee371e760ce26f939efde4c4fa053e09d4","observation_id":"9567268a-eef9-40fd-a8e9-2b82272ab0a7","resolution":{"observed_at":"2026-08-05T11:04:49.804754Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:04:49.637268Z","title":"The voicemos challenge 2024: Beyond speech quality prediction,","venue":null,"work_id":"e3c5d496-2ddf-44ba-9a8a-d269bdb2af33","year":2024},"citing_paper":{"arxiv_id":"2509.03292","last_updated":"2025-09-03T13:19:56Z","snapshot_observed_at":"2026-08-13T15:47:58.625184Z","submitted_at":"2025-09-03T13:19:56Z","title":"Improving Perceptual Audio Aesthetic Assessment via Triplet Loss and Self-Supervised Embeddings","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T11:04:45.815103Z"},"links":{"citing_paper":"/paper/2509.03292"},"observation_digest":"sha256:36d47f3cd3d2fb86eb75f6f1ecea5df6a90e064041a9da15605c288df1e7bab5","observation_id":"c2619186-770a-466a-a56c-a712488fe67f","resolution":{"observed_at":"2026-08-05T11:04:49.664750Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:04:49.455074Z","title":"Fusion of self-supervised learned models for MOS prediction,","venue":null,"work_id":"05ca3f8e-69eb-4b63-9a0c-b7d6f9adbb73","year":2022},"citing_paper":{"arxiv_id":"2509.03292","last_updated":"2025-09-03T13:19:56Z","snapshot_observed_at":"2026-08-13T15:47:58.625184Z","submitted_at":"2025-09-03T13:19:56Z","title":"Improving Perceptual Audio Aesthetic Assessment via Triplet Loss and Self-Supervised Embeddings","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T11:04:45.829892Z"},"links":{"citing_paper":"/paper/2509.03292"},"observation_digest":"sha256:d552c4bdfcd08b8c6c9d99f43aa0b3ddf4f42fe2c458d3439f214f0bcda418a4","observation_id":"63b89fdb-bc2e-4edd-af12-75407fc573ce","resolution":{"observed_at":"2026-08-05T11:04:49.574796Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:04:49.194755Z","title":"UTMOS: UTokyo-SaruLab system for V oiceMOS Chal- lenge 2022,","venue":null,"work_id":"f523f513-fc6b-4fc0-97f1-01fbb397f348","year":2022},"citing_paper":{"arxiv_id":"2509.03292","last_updated":"2025-09-03T13:19:56Z","snapshot_observed_at":"2026-08-13T15:47:58.625184Z","submitted_at":"2025-09-03T13:19:56Z","title":"Improving Perceptual Audio Aesthetic Assessment via Triplet Loss and Self-Supervised Embeddings","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T11:04:45.861257Z"},"links":{"citing_paper":"/paper/2509.03292"},"observation_digest":"sha256:3ed7fc4f81d1a3af205da40b768301c05b878e0c6bd61c2b75e3c1316fd10c82","observation_id":"2f397553-9393-4d7d-90a1-558ec1d3de1b","resolution":{"observed_at":"2026-08-05T11:04:49.287377Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:04:48.974745Z","title":"A study on incorporating Whisper for robust speech assessment,","venue":null,"work_id":"ebbf3535-e27b-48ab-b480-677be1237041","year":2024},"citing_paper":{"arxiv_id":"2509.03292","last_updated":"2025-09-03T13:19:56Z","snapshot_observed_at":"2026-08-13T15:47:58.625184Z","submitted_at":"2025-09-03T13:19:56Z","title":"Improving Perceptual Audio Aesthetic Assessment via Triplet Loss and Self-Supervised Embeddings","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T11:04:45.877952Z"},"links":{"citing_paper":"/paper/2509.03292"},"observation_digest":"sha256:30781e5df11cd79f6fc2c34a9975c770d210526158937b2fc033f61178972737","observation_id":"e24e072a-f79a-4620-ae78-c5ef5863ce3e","resolution":{"observed_at":"2026-08-05T11:04:49.044899Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:04:48.751719Z","title":"Corn: Co-trained full- and no-reference speech quality assessment,","venue":null,"work_id":"1460f84f-1e33-4831-809b-20c71af66db2","year":2024},"citing_paper":{"arxiv_id":"2509.03292","last_updated":"2025-09-03T13:19:56Z","snapshot_observed_at":"2026-08-13T15:47:58.625184Z","submitted_at":"2025-09-03T13:19:56Z","title":"Improving Perceptual Audio Aesthetic Assessment via Triplet Loss and Self-Supervised Embeddings","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T11:04:45.897598Z"},"links":{"citing_paper":"/paper/2509.03292"},"observation_digest":"sha256:e350f96aac22b23d09d8eef9b005f81fd3f1746d6605d9953bb91f2717fc06f5","observation_id":"525cc080-8a22-4e23-963e-6c0f47a24838","resolution":{"observed_at":"2026-08-05T11:04:48.819873Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:04:48.510322Z","title":"Enabling auditory large language models for automatic speech quality evaluation,","venue":null,"work_id":"83d13398-7a06-4117-9f05-6a797b17b703","year":2025},"citing_paper":{"arxiv_id":"2509.03292","last_updated":"2025-09-03T13:19:56Z","snapshot_observed_at":"2026-08-13T15:47:58.625184Z","submitted_at":"2025-09-03T13:19:56Z","title":"Improving Perceptual Audio Aesthetic Assessment via Triplet Loss and Self-Supervised Embeddings","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T11:04:45.924752Z"},"links":{"citing_paper":"/paper/2509.03292"},"observation_digest":"sha256:515c9b6578ab21327ccf192fe96ae6fca1ff6cf382e98e3d0174ad390a3ba6f0","observation_id":"a585ad7b-8c1f-489e-b033-09fc09661743","resolution":{"observed_at":"2026-08-05T11:04:48.642848Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:04:48.292605Z","title":"Speech foundation models on intelligibility prediction for hearing-impaired listeners,","venue":null,"work_id":"a4bd1b62-8a19-43f4-ae30-ccce76d81cf1","year":2024},"citing_paper":{"arxiv_id":"2509.03292","last_updated":"2025-09-03T13:19:56Z","snapshot_observed_at":"2026-08-13T15:47:58.625184Z","submitted_at":"2025-09-03T13:19:56Z","title":"Improving Perceptual Audio Aesthetic Assessment via Triplet Loss and Self-Supervised Embeddings","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T11:04:45.965072Z"},"links":{"citing_paper":"/paper/2509.03292"},"observation_digest":"sha256:447476c6aefaf3f494681eae65e7b6afb2d7d1ade8a923c43d93a01fcec13750","observation_id":"5ff3ec75-e2b8-4988-9d3e-1c5cb503a623","resolution":{"observed_at":"2026-08-05T11:04:48.358044Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:04:48.173404Z","title":"Non-intrusive speech intelligibility prediction for hearing- impaired users using intermediate ASR features and human memory models,","venue":null,"work_id":"f30a406a-e2c8-4407-98e6-8f88d6012a3b","year":2024},"citing_paper":{"arxiv_id":"2509.03292","last_updated":"2025-09-03T13:19:56Z","snapshot_observed_at":"2026-08-13T15:47:58.625184Z","submitted_at":"2025-09-03T13:19:56Z","title":"Improving Perceptual Audio Aesthetic Assessment via Triplet Loss and Self-Supervised Embeddings","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T11:04:45.984833Z"},"links":{"citing_paper":"/paper/2509.03292"},"observation_digest":"sha256:c4652c93338bb573043b6d0b23032ef434efde013f5cda322b2c41d5a505534b","observation_id":"6b0422e6-2a41-4b30-aab6-f039c8a1485a","resolution":{"observed_at":"2026-08-05T11:04:48.234178Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:04:48.026087Z","title":"A review on subjective and objective evaluation of synthetic speech,","venue":null,"work_id":"c41a2b11-9229-4e45-bfd7-cc53c8876237","year":2024},"citing_paper":{"arxiv_id":"2509.03292","last_updated":"2025-09-03T13:19:56Z","snapshot_observed_at":"2026-08-13T15:47:58.625184Z","submitted_at":"2025-09-03T13:19:56Z","title":"Improving Perceptual Audio Aesthetic Assessment via Triplet Loss and Self-Supervised Embeddings","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T11:04:46.034755Z"},"links":{"citing_paper":"/paper/2509.03292"},"observation_digest":"sha256:75ec90f4bec202feef476bd760286819acdbcc6545e07121ab24747925287b5f","observation_id":"e96fcfb8-51fc-4839-8e77-a5be341db9f6","resolution":{"observed_at":"2026-08-05T11:04:48.090620Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:04:47.891997Z","title":"Self-supervised speech quality estimation and enhancement using only clean speech,","venue":null,"work_id":"2735768c-2daa-4334-aa52-b70a149cca95","year":2024},"citing_paper":{"arxiv_id":"2509.03292","last_updated":"2025-09-03T13:19:56Z","snapshot_observed_at":"2026-08-13T15:47:58.625184Z","submitted_at":"2025-09-03T13:19:56Z","title":"Improving Perceptual Audio Aesthetic Assessment via Triplet Loss and Self-Supervised Embeddings","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T11:04:46.076073Z"},"links":{"citing_paper":"/paper/2509.03292"},"observation_digest":"sha256:d02ab80da8a9e8e896f5b20edc019ee8b0e02c8c26a72d3e4420c9a456e231ea","observation_id":"3d00225f-8c76-4cf9-81ef-fd826fae7a74","resolution":{"observed_at":"2026-08-05T11:04:47.954912Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:04:47.733037Z","title":"Generalization ability of MOS prediction networks,","venue":null,"work_id":"4c0a4b08-9f6f-499a-9785-ce9516e70135","year":2022},"citing_paper":{"arxiv_id":"2509.03292","last_updated":"2025-09-03T13:19:56Z","snapshot_observed_at":"2026-08-13T15:47:58.625184Z","submitted_at":"2025-09-03T13:19:56Z","title":"Improving Perceptual Audio Aesthetic Assessment via Triplet Loss and Self-Supervised Embeddings","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T11:04:46.083341Z"},"links":{"citing_paper":"/paper/2509.03292"},"observation_digest":"sha256:a180d613671be46373f511cbaf178c7c5f417eb39c3b6490c312d8c9a9672bbe","observation_id":"956ee022-43bc-4f78-bf2d-c9fa8c2f8ab6","resolution":{"observed_at":"2026-08-05T11:04:47.807494Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:04:47.536734Z","title":"Deep learning-based non-intrusive multi-objective speech assessment model with cross-domain features,","venue":null,"work_id":"8a6d39d7-a294-46e8-95d5-ae43f971a33c","year":2023},"citing_paper":{"arxiv_id":"2509.03292","last_updated":"2025-09-03T13:19:56Z","snapshot_observed_at":"2026-08-13T15:47:58.625184Z","submitted_at":"2025-09-03T13:19:56Z","title":"Improving Perceptual Audio Aesthetic Assessment via Triplet Loss and Self-Supervised Embeddings","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T11:04:46.097720Z"},"links":{"citing_paper":"/paper/2509.03292"},"observation_digest":"sha256:2135e9fa31cd554151cc09389ca652b040f8076d0e9850eabce7c0747ecdc54e","observation_id":"1c7fed5d-9104-4af0-8c3c-5fec5e99ef6f","resolution":{"observed_at":"2026-08-05T11:04:47.617912Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:04:47.345067Z","title":"Speechlmscore: Evaluat- ing speech generation using speech language model,","venue":null,"work_id":"ae431a23-8a20-4e50-80ba-1463e9ab52dd","year":2023},"citing_paper":{"arxiv_id":"2509.03292","last_updated":"2025-09-03T13:19:56Z","snapshot_observed_at":"2026-08-13T15:47:58.625184Z","submitted_at":"2025-09-03T13:19:56Z","title":"Improving Perceptual Audio Aesthetic Assessment via Triplet Loss and Self-Supervised Embeddings","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T11:04:46.162639Z"},"links":{"citing_paper":"/paper/2509.03292"},"observation_digest":"sha256:6cc5c7f8cdfdc5b0a9fd6062a95d0b0b3364a9fdf303997fbb26711297cfbccf","observation_id":"edefb18b-f081-48bb-96c6-4d6210cf10a9","resolution":{"observed_at":"2026-08-05T11:04:47.416887Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:04:47.136660Z","title":"BEATs: Audio pre-training with acoustic tokenizers,","venue":null,"work_id":"2a49d7e6-7bd1-468a-945e-6ef388497767","year":2023},"citing_paper":{"arxiv_id":"2509.03292","last_updated":"2025-09-03T13:19:56Z","snapshot_observed_at":"2026-08-13T15:47:58.625184Z","submitted_at":"2025-09-03T13:19:56Z","title":"Improving Perceptual Audio Aesthetic Assessment via Triplet Loss and Self-Supervised Embeddings","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T11:04:46.168984Z"},"links":{"citing_paper":"/paper/2509.03292"},"observation_digest":"sha256:59ddce349c18a5fbf5db2aa1bce3c60af08163cea4357e98185ae872bdcb9526","observation_id":"f77c807d-9c99-4570-89d1-b8a4cef47988","resolution":{"observed_at":"2026-08-05T11:04:47.215679Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:04:46.927885Z","title":"MBNet: MOS prediction for synthesized speech with mean-bias network,","venue":null,"work_id":"3bfcff3d-a747-4d57-acca-742cb6126abd","year":2021},"citing_paper":{"arxiv_id":"2509.03292","last_updated":"2025-09-03T13:19:56Z","snapshot_observed_at":"2026-08-13T15:47:58.625184Z","submitted_at":"2025-09-03T13:19:56Z","title":"Improving Perceptual Audio Aesthetic Assessment via Triplet Loss and Self-Supervised Embeddings","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T11:04:46.188563Z"},"links":{"citing_paper":"/paper/2509.03292"},"observation_digest":"sha256:b4fb599611dd31963471f4c5d4bd0471d9c9c7c502cbea371cd736342bd2829d","observation_id":"83ef93fd-94b9-42be-9f3d-71b756dafc1a","resolution":{"observed_at":"2026-08-05T11:04:46.999369Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:04:46.773787Z","title":"LDNet: Unified listener dependent modeling in MOS prediction for synthetic speech,","venue":null,"work_id":"acfc43d7-cd29-4f1d-867d-17c7a0cf5112","year":2022},"citing_paper":{"arxiv_id":"2509.03292","last_updated":"2025-09-03T13:19:56Z","snapshot_observed_at":"2026-08-13T15:47:58.625184Z","submitted_at":"2025-09-03T13:19:56Z","title":"Improving Perceptual Audio Aesthetic Assessment via Triplet Loss and Self-Supervised Embeddings","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T11:04:46.207045Z"},"links":{"citing_paper":"/paper/2509.03292"},"observation_digest":"sha256:df087967ae88441800afa0e26154c81d0e2ce8f679f1c96dfa76404dc5d1825e","observation_id":"35cfd7a4-db72-4a07-a230-6b365b7cfbfa","resolution":{"observed_at":"2026-08-05T11:04:46.797786Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:04:46.707109Z","title":"HAAQI- Net: A non-intrusive neural music audio quality assessment model for hearing aids,","venue":null,"work_id":"9e2baaa4-36a3-4216-b828-daadf083a72a","year":2025},"citing_paper":{"arxiv_id":"2509.03292","last_updated":"2025-09-03T13:19:56Z","snapshot_observed_at":"2026-08-13T15:47:58.625184Z","submitted_at":"2025-09-03T13:19:56Z","title":"Improving Perceptual Audio Aesthetic Assessment via Triplet Loss and Self-Supervised Embeddings","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T11:04:46.211742Z"},"links":{"citing_paper":"/paper/2509.03292"},"observation_digest":"sha256:e34cf2a89d1e22023f34be5d32797ee60a3d4b529a32b877980b88c1c8eb7e6f","observation_id":"31fcf490-1523-45ff-a782-7b7d19f25e0d","resolution":{"observed_at":"2026-08-05T11:04:46.737263Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:04:46.618976Z","title":"FaceNet: A unified embed- ding for face recognition and clustering,","venue":null,"work_id":"80e0aa73-a18b-4212-bbbe-88948bcd8b44","year":2015},"citing_paper":{"arxiv_id":"2509.03292","last_updated":"2025-09-03T13:19:56Z","snapshot_observed_at":"2026-08-13T15:47:58.625184Z","submitted_at":"2025-09-03T13:19:56Z","title":"Improving Perceptual Audio Aesthetic Assessment via Triplet Loss and Self-Supervised Embeddings","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T11:04:46.225739Z"},"links":{"citing_paper":"/paper/2509.03292"},"observation_digest":"sha256:b81522a45f2d04c36f76eb4592585ebb195a3694ed4155941f3d167e28c39191","observation_id":"384d0956-531d-40ee-8827-e20475294701","resolution":{"observed_at":"2026-08-05T11:04:46.659417Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:04:46.514993Z","title":"Unsupervised feature learning via non-parametric instance discrimination,","venue":null,"work_id":"f3543604-32b7-4a63-9e8d-026e872a39ba","year":2018},"citing_paper":{"arxiv_id":"2509.03292","last_updated":"2025-09-03T13:19:56Z","snapshot_observed_at":"2026-08-13T15:47:58.625184Z","submitted_at":"2025-09-03T13:19:56Z","title":"Improving Perceptual Audio Aesthetic Assessment via Triplet Loss and Self-Supervised Embeddings","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T11:04:46.274755Z"},"links":{"citing_paper":"/paper/2509.03292"},"observation_digest":"sha256:43a59b440919bdb1c58d8a05300adf04674eb4be1734796cde32b21b2a279143","observation_id":"0b919c50-5eae-4dad-8989-9c092755494a","resolution":{"observed_at":"2026-08-05T11:04:46.558959Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05139","last_updated":"2025-02-07T18:15:57Z","snapshot_observed_at":"2026-08-14T10:00:02.244477Z","submitted_at":"2025-02-07T18:15:57Z","title":"Meta Audiobox Aesthetics: Unified Automatic Quality Assessment for Speech, Music, and Sound","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05139","snapshot_observed_at":"2026-08-05T11:04:46.304755Z","title":"Meta audiobox aesthet- ics: Unified automatic quality assessment for speech,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.03292","last_updated":"2025-09-03T13:19:56Z","snapshot_observed_at":"2026-08-13T15:47:58.625184Z","submitted_at":"2025-09-03T13:19:56Z","title":"Improving Perceptual Audio Aesthetic Assessment via Triplet Loss and Self-Supervised Embeddings","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T11:04:46.304755Z"},"links":{"cited_paper":"/paper/2502.05139","citing_paper":"/paper/2509.03292"},"observation_digest":"sha256:59329c852c2935751444b2c01d60720ff44b7b3dff71834f8191b79e13705ad6","observation_id":"a7c5feaa-4371-4fa3-acac-4a755db43373","resolution":{"observed_at":"2026-08-05T11:04:46.304755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.03292","last_updated":"2025-09-03T13:19:56Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-13T15:47:58.625184Z","submitted_at":"2025-09-03T13:19:56Z","title":"Improving Perceptual Audio Aesthetic Assessment via Triplet Loss and Self-Supervised Embeddings"},"reference_resolution":{"displayed":22,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":1,"verified_exact":0,"verified_fuzzy":21},"total_outbound_references":22},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 22 of 22 outbound references and 1 inbound Pith citation observation for arXiv:2509.03292."}