{"as_of":"2026-08-15T21:52:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:30f7e6bb5c9f1f1569b7cbdf76d5ab6a5689f508ca72bd36242a8c13bf69e976","coverage":[{"denominator":91,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":91,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-31T16:58:30.367314Z","state":"measured"},{"denominator":91,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":91,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.28129/citation-record","integrity":"/paper/2607.28129/integrity","json":"/paper/2607.28129/citation-record.json","paper":"/paper/2607.28129"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:58:24.743906Z","title":"Visual Cognition25(4- 6), 611–628 (2017)","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.28129","last_updated":"2026-07-30T12:37:58Z","snapshot_observed_at":"2026-08-14T17:25:55.995167Z","submitted_at":"2026-07-30T12:37:58Z","title":"Face and Voice Cross-modal Association with Learning Convex Feature Embedding","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-31T16:58:24.743906Z"},"links":{"citing_paper":"/paper/2607.28129"},"observation_digest":"sha256:90f53bf4f76a3f610b189828cd3def2f84d71a980adaa04faf32e069d4c2bcc9","observation_id":"4d2bb362-cc03-40a5-8e2b-aae0b2842719","resolution":{"observed_at":"2026-07-31T16:58:24.743906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:58:24.858600Z","title":"Trends in Cognitive Sciences 17(6), 263–271 (2013)","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2607.28129","last_updated":"2026-07-30T12:37:58Z","snapshot_observed_at":"2026-08-14T17:25:55.995167Z","submitted_at":"2026-07-30T12:37:58Z","title":"Face and Voice Cross-modal Association with Learning Convex Feature Embedding","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-31T16:58:24.858600Z"},"links":{"citing_paper":"/paper/2607.28129"},"observation_digest":"sha256:4e443be09c2c20f506688e8922537a3430595d41117aa8d2c601631743a66f73","observation_id":"9c969937-f3af-4af8-bee2-b89c7914c187","resolution":{"observed_at":"2026-07-31T16:58:24.858600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:58:25.021245Z","title":"Neuroimage 54(2), 1654–1661 (2011)","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2607.28129","last_updated":"2026-07-30T12:37:58Z","snapshot_observed_at":"2026-08-14T17:25:55.995167Z","submitted_at":"2026-07-30T12:37:58Z","title":"Face and Voice Cross-modal Association with Learning Convex Feature Embedding","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-31T16:58:25.021245Z"},"links":{"citing_paper":"/paper/2607.28129"},"observation_digest":"sha256:2cdb8ed9b34953d1bbc0cb700420f028aec4da42e01b1fe908a36fd7276777a6","observation_id":"686111a2-30bc-4629-997a-4a203741af35","resolution":{"observed_at":"2026-07-31T16:58:25.021245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:58:25.139106Z","title":"Computer Speech & Language 60, 101027 (2020)","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.28129","last_updated":"2026-07-30T12:37:58Z","snapshot_observed_at":"2026-08-14T17:25:55.995167Z","submitted_at":"2026-07-30T12:37:58Z","title":"Face and Voice Cross-modal Association with Learning Convex Feature Embedding","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-31T16:58:25.139106Z"},"links":{"citing_paper":"/paper/2607.28129"},"observation_digest":"sha256:7b4dfd2e5dc6838717bea559a8b18c208e051a67ede2d87ccef470455fd06604","observation_id":"97c22b0d-c12c-40e4-9fec-e5c1979cdd2f","resolution":{"observed_at":"2026-07-31T16:58:25.139106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:58:25.229484Z","title":"In: Proceedings of the International Conference on Multimedia Retrieval, pp","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.28129","last_updated":"2026-07-30T12:37:58Z","snapshot_observed_at":"2026-08-14T17:25:55.995167Z","submitted_at":"2026-07-30T12:37:58Z","title":"Face and Voice Cross-modal Association with Learning Convex Feature Embedding","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-31T16:58:25.229484Z"},"links":{"citing_paper":"/paper/2607.28129"},"observation_digest":"sha256:a9d3a574d5c70d418501a1b85d5ca366e3d5d373a4ebc4f25c98af0d2579cda4","observation_id":"b7e83dcc-76d7-49c0-b617-3c33ecf54b3b","resolution":{"observed_at":"2026-07-31T16:58:25.229484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:58:25.302059Z","title":"10452–10461","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.28129","last_updated":"2026-07-30T12:37:58Z","snapshot_observed_at":"2026-08-14T17:25:55.995167Z","submitted_at":"2026-07-30T12:37:58Z","title":"Face and Voice Cross-modal Association with Learning Convex Feature Embedding","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-31T16:58:25.302059Z"},"links":{"citing_paper":"/paper/2607.28129"},"observation_digest":"sha256:aa9ee054e0597ab348994a9952281fa9b99be7b79b1186ad93fdbb8907d51eab","observation_id":"985badbb-bbfc-42ef-8a18-b10d939134cf","resolution":{"observed_at":"2026-07-31T16:58:25.302059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:58:25.347854Z","title":"In: Proceedings of the IEEE International Conference on Acoustics, Speech and Signal Processing, pp","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.28129","last_updated":"2026-07-30T12:37:58Z","snapshot_observed_at":"2026-08-14T17:25:55.995167Z","submitted_at":"2026-07-30T12:37:58Z","title":"Face and Voice Cross-modal Association with Learning Convex Feature Embedding","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-31T16:58:25.347854Z"},"links":{"citing_paper":"/paper/2607.28129"},"observation_digest":"sha256:4359eaefeec54851598accb36fd8ce210c82c69b619218e47be35b0f76b9cd12","observation_id":"962e48bd-2de1-4bd6-8271-fc860b50be83","resolution":{"observed_at":"2026-07-31T16:58:25.347854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:58:25.389181Z","title":"In: Proceedings of the ACM SIGIR Conference on Research and Development in Information Retrieval, pp","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.28129","last_updated":"2026-07-30T12:37:58Z","snapshot_observed_at":"2026-08-14T17:25:55.995167Z","submitted_at":"2026-07-30T12:37:58Z","title":"Face and Voice Cross-modal Association with Learning Convex Feature Embedding","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-31T16:58:25.389181Z"},"links":{"citing_paper":"/paper/2607.28129"},"observation_digest":"sha256:ec847795a19ff357f838a2544c9eaa7bd48566ec540caa9136a57e18b3bc427f","observation_id":"b1e03d0e-e71d-4cb9-8cb1-955a037e2edf","resolution":{"observed_at":"2026-07-31T16:58:25.389181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:58:25.449662Z","title":"In: Proceedings of the ACM International Conference 26 on Multimedia, pp","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.28129","last_updated":"2026-07-30T12:37:58Z","snapshot_observed_at":"2026-08-14T17:25:55.995167Z","submitted_at":"2026-07-30T12:37:58Z","title":"Face and Voice Cross-modal Association with Learning Convex Feature Embedding","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-31T16:58:25.449662Z"},"links":{"citing_paper":"/paper/2607.28129"},"observation_digest":"sha256:a3191e2dd0e5c7a234a86705c2850bd0d0f64f0c1244360a5159f2e204e49843","observation_id":"928e2db0-8c61-46d5-ae9e-9d9269e30955","resolution":{"observed_at":"2026-07-31T16:58:25.449662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:58:25.494659Z","title":"In: Proceedings of the Asian Conference on Computer Vision, pp","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.28129","last_updated":"2026-07-30T12:37:58Z","snapshot_observed_at":"2026-08-14T17:25:55.995167Z","submitted_at":"2026-07-30T12:37:58Z","title":"Face and Voice Cross-modal Association with Learning Convex Feature Embedding","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-31T16:58:25.494659Z"},"links":{"citing_paper":"/paper/2607.28129"},"observation_digest":"sha256:bc9fcac21bd213da0c22dfde9ae373d572ca1150cb2cedfaa792a30c2f3e498b","observation_id":"192355bd-1da8-4451-abcf-bac8635c37f0","resolution":{"observed_at":"2026-07-31T16:58:25.494659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:58:25.553473Z","title":"In: Proceedings of the Digital Image Computing: Techniques and Applications, pp","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.28129","last_updated":"2026-07-30T12:37:58Z","snapshot_observed_at":"2026-08-14T17:25:55.995167Z","submitted_at":"2026-07-30T12:37:58Z","title":"Face and Voice Cross-modal Association with Learning Convex Feature Embedding","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-31T16:58:25.553473Z"},"links":{"citing_paper":"/paper/2607.28129"},"observation_digest":"sha256:d9e3eb1cc945432b4a1c9426608f9820b10b57694e6d92d89b529cc0986af3e5","observation_id":"e2001a9d-d2c1-4594-8957-e62ba1b6b7ea","resolution":{"observed_at":"2026-07-31T16:58:25.553473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.09338","last_updated":"2019-12-30T12:36:50Z","snapshot_observed_at":"2026-08-12T22:42:20.427144Z","submitted_at":"2019-11-21T08:34:34Z","title":"Voice-Face Cross-modal Matching and Retrieval: A Benchmark","version":2},"cited_work":{"arxiv_id":"1911.09338","doi":"10.48550/arxiv.1911.09338","metadata_source":"pith","pith_arxiv_id":"1911.09338","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Voice-Face Cross-modal Matching and Retrieval: A Benchmark","venue":"cs.CV","work_id":"ca77589e-18c8-4cc9-9e05-82d43afbc0d9","year":2019},"citing_paper":{"arxiv_id":"2607.28129","last_updated":"2026-07-30T12:37:58Z","snapshot_observed_at":"2026-08-14T17:25:55.995167Z","submitted_at":"2026-07-30T12:37:58Z","title":"Face and Voice Cross-modal Association with Learning Convex Feature Embedding","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-31T16:58:25.615014Z"},"links":{"cited_paper":"/paper/1911.09338","citing_paper":"/paper/2607.28129"},"observation_digest":"sha256:c103d39d20bebd479d1ef9de1938f69c6a91a84a964197d3d344346d02923d1a","observation_id":"c915e5a9-f87e-432e-961e-a40a90345b41","resolution":{"observed_at":"2026-07-31T17:01:26.088792Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:58:25.677713Z","title":"In: Proceedings of the European Conference on Computer Vision, pp","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.28129","last_updated":"2026-07-30T12:37:58Z","snapshot_observed_at":"2026-08-14T17:25:55.995167Z","submitted_at":"2026-07-30T12:37:58Z","title":"Face and Voice Cross-modal Association with Learning Convex Feature Embedding","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-31T16:58:25.677713Z"},"links":{"citing_paper":"/paper/2607.28129"},"observation_digest":"sha256:940707b70804171987dd99586fe8127cf4f06602afc56d8af1d893f970f0f2f6","observation_id":"9d8c29b4-d338-41fe-819f-2cd5693d8181","resolution":{"observed_at":"2026-07-31T16:58:25.677713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:58:25.766345Z","title":"In: Proceedings of the ACM International Conference on Multime- dia, pp","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.28129","last_updated":"2026-07-30T12:37:58Z","snapshot_observed_at":"2026-08-14T17:25:55.995167Z","submitted_at":"2026-07-30T12:37:58Z","title":"Face and Voice Cross-modal Association with Learning Convex Feature Embedding","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-31T16:58:25.766345Z"},"links":{"citing_paper":"/paper/2607.28129"},"observation_digest":"sha256:3eb89df0cf91c3955366a4b41bb40e90fc8086a0e8374a75e6a4eccec25dc01e","observation_id":"23f8b20a-12dd-4b18-9714-ebd4dd4528f7","resolution":{"observed_at":"2026-07-31T16:58:25.766345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1807.04836","last_updated":"2018-07-16T01:00:13Z","snapshot_observed_at":"2026-08-14T18:52:32.950213Z","submitted_at":"2018-07-12T21:37:34Z","title":"Disjoint Mapping Network for Cross-modal Matching of Voices and Faces","version":2},"cited_work":{"arxiv_id":"1807.04836","doi":"10.48550/arxiv.1807.04836","metadata_source":"pith","pith_arxiv_id":"1807.04836","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Disjoint Mapping Network for Cross-modal Matching of Voices and Faces","venue":"cs.CV","work_id":"14a83f75-af41-46bb-8abf-26f947fcca92","year":2018},"citing_paper":{"arxiv_id":"2607.28129","last_updated":"2026-07-30T12:37:58Z","snapshot_observed_at":"2026-08-14T17:25:55.995167Z","submitted_at":"2026-07-30T12:37:58Z","title":"Face and Voice Cross-modal Association with Learning Convex Feature Embedding","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-31T16:58:25.842336Z"},"links":{"cited_paper":"/paper/1807.04836","citing_paper":"/paper/2607.28129"},"observation_digest":"sha256:f63806537ec8221aaf857cbdc19d88ef45e0a51eac3d3e04a01d979b7e50daf4","observation_id":"67056eda-79df-496c-91b0-28f00d139dc6","resolution":{"observed_at":"2026-07-31T17:01:25.818112Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:58:25.895313Z","title":"In: Lee, D., Sugiyama, M., Luxburg, U., Guyon, I., Garnett, R","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.28129","last_updated":"2026-07-30T12:37:58Z","snapshot_observed_at":"2026-08-14T17:25:55.995167Z","submitted_at":"2026-07-30T12:37:58Z","title":"Face and Voice Cross-modal Association with Learning Convex Feature Embedding","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-31T16:58:25.895313Z"},"links":{"citing_paper":"/paper/2607.28129"},"observation_digest":"sha256:20b03b0458e38b782ff2355dcbd3cd973fd939cf57206bc043c78ce93193279e","observation_id":"4b94733d-fa62-4ba8-8e70-a70c1faa2440","resolution":{"observed_at":"2026-07-31T16:58:25.895313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:58:25.932880Z","title":"In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.28129","last_updated":"2026-07-30T12:37:58Z","snapshot_observed_at":"2026-08-14T17:25:55.995167Z","submitted_at":"2026-07-30T12:37:58Z","title":"Face and Voice Cross-modal Association with Learning Convex Feature Embedding","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-31T16:58:25.932880Z"},"links":{"citing_paper":"/paper/2607.28129"},"observation_digest":"sha256:001e459cddd284c93e3586eb79f2dcbde2e816e1a846ea16061d0709593b1330","observation_id":"05d8d7ce-00ff-4fba-848b-3de166388284","resolution":{"observed_at":"2026-07-31T16:58:25.932880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:58:25.992643Z","title":"In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, vol","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2607.28129","last_updated":"2026-07-30T12:37:58Z","snapshot_observed_at":"2026-08-14T17:25:55.995167Z","submitted_at":"2026-07-30T12:37:58Z","title":"Face and Voice Cross-modal Association with Learning Convex Feature Embedding","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-31T16:58:25.992643Z"},"links":{"citing_paper":"/paper/2607.28129"},"observation_digest":"sha256:17d05f3461d5ee53fc707aa9e67144bebf51f65e19c293ef4df7b94cadd14593","observation_id":"e43d28e2-398e-4be2-b943-420c4746e864","resolution":{"observed_at":"2026-07-31T16:58:25.992643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:58:26.050954Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pp","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.28129","last_updated":"2026-07-30T12:37:58Z","snapshot_observed_at":"2026-08-14T17:25:55.995167Z","submitted_at":"2026-07-30T12:37:58Z","title":"Face and Voice Cross-modal Association with Learning Convex Feature Embedding","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-31T16:58:26.050954Z"},"links":{"citing_paper":"/paper/2607.28129"},"observation_digest":"sha256:df59038092f34c8b5c2575584ebaa3142ed6da577f5c962fdc34f1bb63c2cd83","observation_id":"7acfef49-38b0-4ecc-b38e-4629b9b3b627","resolution":{"observed_at":"2026-07-31T16:58:26.050954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:58:26.124612Z","title":"In: Proceedings of the IEEE/CVF Conference on Com- puter Vision and Pattern Recognition, pp","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.28129","last_updated":"2026-07-30T12:37:58Z","snapshot_observed_at":"2026-08-14T17:25:55.995167Z","submitted_at":"2026-07-30T12:37:58Z","title":"Face and Voice Cross-modal Association with Learning Convex Feature Embedding","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-31T16:58:26.124612Z"},"links":{"citing_paper":"/paper/2607.28129"},"observation_digest":"sha256:56d1f9923ffc8fb2dd24e303725d705a6a5b49f6d31b15bf552ac097f82d96ac","observation_id":"c366ad48-7094-4b3a-9bbf-dc3547411aea","resolution":{"observed_at":"2026-07-31T16:58:26.124612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:58:26.186809Z","title":"In: Proceedings of the International Joint Conference on Artificial Intelligence, pp","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.28129","last_updated":"2026-07-30T12:37:58Z","snapshot_observed_at":"2026-08-14T17:25:55.995167Z","submitted_at":"2026-07-30T12:37:58Z","title":"Face and Voice Cross-modal Association with Learning Convex Feature Embedding","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-31T16:58:26.186809Z"},"links":{"citing_paper":"/paper/2607.28129"},"observation_digest":"sha256:4a8803edc1c18380c377679d9f703338fb5f683741bd8ce1dde55329f8f72929","observation_id":"bc5a2134-f9e8-4623-849a-e66a8498d589","resolution":{"observed_at":"2026-07-31T16:58:26.186809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:58:26.244830Z","title":"In: In Proceeding of the IEEE International Conference on Image Processing, New York, NY, USA, pp","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.28129","last_updated":"2026-07-30T12:37:58Z","snapshot_observed_at":"2026-08-14T17:25:55.995167Z","submitted_at":"2026-07-30T12:37:58Z","title":"Face and Voice Cross-modal Association with Learning Convex Feature Embedding","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-31T16:58:26.244830Z"},"links":{"citing_paper":"/paper/2607.28129"},"observation_digest":"sha256:88a71aff0cc6cfc26634bdd922d810b6a9804cb453622399abd86767aeb963e3","observation_id":"c81e5abd-fc5a-42b3-bf1e-13633eb5c765","resolution":{"observed_at":"2026-07-31T16:58:26.244830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:58:26.313618Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pp","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.28129","last_updated":"2026-07-30T12:37:58Z","snapshot_observed_at":"2026-08-14T17:25:55.995167Z","submitted_at":"2026-07-30T12:37:58Z","title":"Face and Voice Cross-modal Association with Learning Convex Feature Embedding","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-31T16:58:26.313618Z"},"links":{"citing_paper":"/paper/2607.28129"},"observation_digest":"sha256:0e16d141752359281711f92d6ff5b942bc0944b83a27f48269ab86e5a3545762","observation_id":"848e1ca5-08f3-4f68-a81c-0afc6009c8be","resolution":{"observed_at":"2026-07-31T16:58:26.313618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:58:26.383855Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pp","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.28129","last_updated":"2026-07-30T12:37:58Z","snapshot_observed_at":"2026-08-14T17:25:55.995167Z","submitted_at":"2026-07-30T12:37:58Z","title":"Face and Voice Cross-modal Association with Learning Convex Feature Embedding","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-31T16:58:26.383855Z"},"links":{"citing_paper":"/paper/2607.28129"},"observation_digest":"sha256:507d32b0ea8e607c665939511b5b24cd4d02dd9f50d61342231b580dba89e367","observation_id":"08c395ac-82a6-472d-bf63-7a489cedf27e","resolution":{"observed_at":"2026-07-31T16:58:26.383855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.14724","last_updated":"2021-08-08T01:57:48Z","snapshot_observed_at":"2026-08-13T18:36:55.843794Z","submitted_at":"2021-07-30T15:55:55Z","title":"Sparse-to-dense Feature Matching: Intra and Inter domain Cross-modal Learning in Domain Adaptation for 3D Semantic Segmentation","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.14724","snapshot_observed_at":"2026-07-31T16:58:26.441532Z","title":"arXiv preprint arXiv:2107.14724 (2021)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.28129","last_updated":"2026-07-30T12:37:58Z","snapshot_observed_at":"2026-08-14T17:25:55.995167Z","submitted_at":"2026-07-30T12:37:58Z","title":"Face and Voice Cross-modal Association with Learning Convex Feature Embedding","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-31T16:58:26.441532Z"},"links":{"cited_paper":"/paper/2107.14724","citing_paper":"/paper/2607.28129"},"observation_digest":"sha256:e54717a0135a25c7ef1fbd8a494af9c825c88ce4f3ee22b7e98d96288d0c21b3","observation_id":"b8970b72-f0b8-4f82-ba52-2874bc2d31ed","resolution":{"observed_at":"2026-07-31T16:58:26.441532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:58:26.491423Z","title":"In: Proceedings of the International ACM SIGIR Conference on Research and Development in Information Retrieval, pp","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28129","last_updated":"2026-07-30T12:37:58Z","snapshot_observed_at":"2026-08-14T17:25:55.995167Z","submitted_at":"2026-07-30T12:37:58Z","title":"Face and Voice Cross-modal Association with Learning Convex Feature Embedding","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-31T16:58:26.491423Z"},"links":{"citing_paper":"/paper/2607.28129"},"observation_digest":"sha256:faae55b8c65e0e85d4df021b31fe7aa0bcc308b7238090b929b5deaa74b5adc6","observation_id":"d2c0ef1a-d920-483c-89fe-236e68553c9f","resolution":{"observed_at":"2026-07-31T16:58:26.491423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:58:26.553160Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pp","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.28129","last_updated":"2026-07-30T12:37:58Z","snapshot_observed_at":"2026-08-14T17:25:55.995167Z","submitted_at":"2026-07-30T12:37:58Z","title":"Face and Voice Cross-modal Association with Learning Convex Feature Embedding","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-31T16:58:26.553160Z"},"links":{"citing_paper":"/paper/2607.28129"},"observation_digest":"sha256:38d88cc5cea554d54294f81abf45ba6a2664738046636438f628ffcf37582b80","observation_id":"5fe72dfd-e6c8-4b06-bcd6-1f6ab171068e","resolution":{"observed_at":"2026-07-31T16:58:26.553160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:58:26.614238Z","title":"Multimedia Systems 29(4), 2073–2083 (2023)","venue":null,"work_id":null,"year":2073},"citing_paper":{"arxiv_id":"2607.28129","last_updated":"2026-07-30T12:37:58Z","snapshot_observed_at":"2026-08-14T17:25:55.995167Z","submitted_at":"2026-07-30T12:37:58Z","title":"Face and Voice Cross-modal Association with Learning Convex Feature Embedding","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-31T16:58:26.614238Z"},"links":{"citing_paper":"/paper/2607.28129"},"observation_digest":"sha256:d4c85b59863da8c1f21d5ee76fe41556df783d7f7bd485d2b4293b633470d9b7","observation_id":"de92d182-b7c6-4715-9c3d-e8f0a99cbd9e","resolution":{"observed_at":"2026-07-31T16:58:26.614238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:58:26.676773Z","title":"International Journal of Multimedia Information Retrieval 13(1), 5 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28129","last_updated":"2026-07-30T12:37:58Z","snapshot_observed_at":"2026-08-14T17:25:55.995167Z","submitted_at":"2026-07-30T12:37:58Z","title":"Face and Voice Cross-modal Association with Learning Convex Feature Embedding","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-31T16:58:26.676773Z"},"links":{"citing_paper":"/paper/2607.28129"},"observation_digest":"sha256:85dec100a5ef6a2265cc555ac1945d64a1fc4d5a1f7f97936fc56a4b90b7726b","observation_id":"630adb18-b76b-4d66-a60a-0f48907bc26d","resolution":{"observed_at":"2026-07-31T16:58:26.676773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:58:26.739384Z","title":"Multimedia Systems 30(2), 113 (2024) 28","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28129","last_updated":"2026-07-30T12:37:58Z","snapshot_observed_at":"2026-08-14T17:25:55.995167Z","submitted_at":"2026-07-30T12:37:58Z","title":"Face and Voice Cross-modal Association with Learning Convex Feature Embedding","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-31T16:58:26.739384Z"},"links":{"citing_paper":"/paper/2607.28129"},"observation_digest":"sha256:89a1ee6aebf9977dee535b1851d0302ff2e15855a0b49d8bc13a6cfe5062c453","observation_id":"18e5fe93-e191-44d7-b591-0c45bb2e432a","resolution":{"observed_at":"2026-07-31T16:58:26.739384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:58:26.802124Z","title":"Multimedia Systems 30(5), 1–14 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28129","last_updated":"2026-07-30T12:37:58Z","snapshot_observed_at":"2026-08-14T17:25:55.995167Z","submitted_at":"2026-07-30T12:37:58Z","title":"Face and Voice Cross-modal Association with Learning Convex Feature Embedding","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-31T16:58:26.802124Z"},"links":{"citing_paper":"/paper/2607.28129"},"observation_digest":"sha256:c92634dcdd9ff1445771073910d0b1b8a328663a12229176f0814d8b8317cc5b","observation_id":"4492ed5d-68fe-408d-9758-5bfe2e66fafc","resolution":{"observed_at":"2026-07-31T16:58:26.802124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:58:26.843052Z","title":"Journal of Intelligent Information Systems, 1–25 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28129","last_updated":"2026-07-30T12:37:58Z","snapshot_observed_at":"2026-08-14T17:25:55.995167Z","submitted_at":"2026-07-30T12:37:58Z","title":"Face and Voice Cross-modal Association with Learning Convex Feature Embedding","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-31T16:58:26.843052Z"},"links":{"citing_paper":"/paper/2607.28129"},"observation_digest":"sha256:8519866f3d539cc0f9e8ac0457c92b6f0b3c182c4418034e0ed531dbba6790c5","observation_id":"2cd76317-e63e-48c2-a7e2-e1e6bdfa3408","resolution":{"observed_at":"2026-07-31T16:58:26.843052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:58:26.919258Z","title":"In: Proceedings of the European Conference on Computer Vision, pp","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2607.28129","last_updated":"2026-07-30T12:37:58Z","snapshot_observed_at":"2026-08-14T17:25:55.995167Z","submitted_at":"2026-07-30T12:37:58Z","title":"Face and Voice Cross-modal Association with Learning Convex Feature Embedding","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-31T16:58:26.919258Z"},"links":{"citing_paper":"/paper/2607.28129"},"observation_digest":"sha256:467d51a3277ddf98deb32f9591b2c93017fc36d4286db9ede4175cc06530d312","observation_id":"6a6b3314-a5fc-4bd3-aa3d-a513e5a39ff1","resolution":{"observed_at":"2026-07-31T16:58:26.919258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:58:26.970435Z","title":"In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, vol","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2607.28129","last_updated":"2026-07-30T12:37:58Z","snapshot_observed_at":"2026-08-14T17:25:55.995167Z","submitted_at":"2026-07-30T12:37:58Z","title":"Face and Voice Cross-modal Association with Learning Convex Feature Embedding","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-31T16:58:26.970435Z"},"links":{"citing_paper":"/paper/2607.28129"},"observation_digest":"sha256:061370d7243057ffa65aae7ef16be85ff173c5b43a3899df8741748dc4a9351a","observation_id":"231db368-2fcc-44bb-b394-a9a90b18c0e0","resolution":{"observed_at":"2026-07-31T16:58:26.970435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:58:27.043982Z","title":"In: Proceedings of the ACM International Conference on Multimedia, pp","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2607.28129","last_updated":"2026-07-30T12:37:58Z","snapshot_observed_at":"2026-08-14T17:25:55.995167Z","submitted_at":"2026-07-30T12:37:58Z","title":"Face and Voice Cross-modal Association with Learning Convex Feature Embedding","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-31T16:58:27.043982Z"},"links":{"citing_paper":"/paper/2607.28129"},"observation_digest":"sha256:7db64eb45a5e511e05d4f7214e935606e573fbf3804d745d1a8bf40c0bb3d961","observation_id":"95f9de29-1958-4e87-8a1b-32fbf20df0d5","resolution":{"observed_at":"2026-07-31T16:58:27.043982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:58:27.088355Z","title":"Journal of Machine Learning Research3, 1107–1135 (2003)","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2607.28129","last_updated":"2026-07-30T12:37:58Z","snapshot_observed_at":"2026-08-14T17:25:55.995167Z","submitted_at":"2026-07-30T12:37:58Z","title":"Face and Voice Cross-modal Association with Learning Convex Feature Embedding","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-31T16:58:27.088355Z"},"links":{"citing_paper":"/paper/2607.28129"},"observation_digest":"sha256:708b6e70699622c95615bd5485e03a76e78e879afdd41ef9e35a175a0cb7a41f","observation_id":"5a2e19e3-0103-47a0-b382-cfe723f238bf","resolution":{"observed_at":"2026-07-31T16:58:27.088355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:58:27.137117Z","title":"In: Pro- ceedings of the European Conference on Computer Vision, pp","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2607.28129","last_updated":"2026-07-30T12:37:58Z","snapshot_observed_at":"2026-08-14T17:25:55.995167Z","submitted_at":"2026-07-30T12:37:58Z","title":"Face and Voice Cross-modal Association with Learning Convex Feature Embedding","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-31T16:58:27.137117Z"},"links":{"citing_paper":"/paper/2607.28129"},"observation_digest":"sha256:c4e2340290c551ea6896a14bc4ac46d0f30756f4e42b2bfbb937b3363e74e347","observation_id":"55036862-a78e-4170-95d1-273d70871c78","resolution":{"observed_at":"2026-07-31T16:58:27.137117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:58:27.202478Z","title":"In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.28129","last_updated":"2026-07-30T12:37:58Z","snapshot_observed_at":"2026-08-14T17:25:55.995167Z","submitted_at":"2026-07-30T12:37:58Z","title":"Face and Voice Cross-modal Association with Learning Convex Feature Embedding","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-31T16:58:27.202478Z"},"links":{"citing_paper":"/paper/2607.28129"},"observation_digest":"sha256:3f3a33fa2253bbc040a9af2e4b0d7d6e5b5fd9ccbbdaf75e90109fd471fe4251","observation_id":"e4e8b59f-8389-4d5c-a3e3-b6c69ea1a3bf","resolution":{"observed_at":"2026-07-31T16:58:27.202478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1411.2539","last_updated":"2014-11-10T19:09:41Z","snapshot_observed_at":"2026-08-14T23:12:14.296355Z","submitted_at":"2014-11-10T19:09:41Z","title":"Unifying Visual-Semantic Embeddings with Multimodal Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1411.2539","snapshot_observed_at":"2026-07-31T16:58:27.233496Z","title":"arXiv (2014)","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2607.28129","last_updated":"2026-07-30T12:37:58Z","snapshot_observed_at":"2026-08-14T17:25:55.995167Z","submitted_at":"2026-07-30T12:37:58Z","title":"Face and Voice Cross-modal Association with Learning Convex Feature Embedding","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-31T16:58:27.233496Z"},"links":{"cited_paper":"/paper/1411.2539","citing_paper":"/paper/2607.28129"},"observation_digest":"sha256:3313e1cb676a24a26adbcbe3a99ac426b38a208c1e630da1955f572c1a4e5097","observation_id":"f89f9c64-3966-45a3-9249-ee2489b89484","resolution":{"observed_at":"2026-07-31T16:58:27.233496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:58:27.282651Z","title":"In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.28129","last_updated":"2026-07-30T12:37:58Z","snapshot_observed_at":"2026-08-14T17:25:55.995167Z","submitted_at":"2026-07-30T12:37:58Z","title":"Face and Voice Cross-modal Association with Learning Convex Feature Embedding","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-31T16:58:27.282651Z"},"links":{"citing_paper":"/paper/2607.28129"},"observation_digest":"sha256:703ee3770f578ca9ac739f5686c36dd2d5d31f9de221e5be52eb3a072d61d514","observation_id":"a6ac6c0a-4fbe-4b74-b041-ea2a727cecf1","resolution":{"observed_at":"2026-07-31T16:58:27.282651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:58:27.336471Z","title":"In: Proceedings of the AAAI Conference on Artificial Intelligence, pp","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.28129","last_updated":"2026-07-30T12:37:58Z","snapshot_observed_at":"2026-08-14T17:25:55.995167Z","submitted_at":"2026-07-30T12:37:58Z","title":"Face and Voice Cross-modal Association with Learning Convex Feature Embedding","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-31T16:58:27.336471Z"},"links":{"citing_paper":"/paper/2607.28129"},"observation_digest":"sha256:686c64cb4aa2a189b575a267de01512c6ab439722bfecc1bd39a053e05a9365e","observation_id":"f0804f18-d2e2-46d5-8f89-67bf7f61eb6b","resolution":{"observed_at":"2026-07-31T16:58:27.336471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:58:27.372534Z","title":"In: Proceedings of the IEEE/CVF International Conference on Computer Vision, pp","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.28129","last_updated":"2026-07-30T12:37:58Z","snapshot_observed_at":"2026-08-14T17:25:55.995167Z","submitted_at":"2026-07-30T12:37:58Z","title":"Face and Voice Cross-modal Association with Learning Convex Feature Embedding","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-31T16:58:27.372534Z"},"links":{"citing_paper":"/paper/2607.28129"},"observation_digest":"sha256:ec95a6ff50aaf6f14ca1f3770c69e15d59b3d2a3a53c12ef01e1db4c6d6a11da","observation_id":"5abbd7d7-dbde-4d84-b356-158d631eef7d","resolution":{"observed_at":"2026-07-31T16:58:27.372534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:58:27.430425Z","title":"World Wide Web 22, 657–672 (2019)","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.28129","last_updated":"2026-07-30T12:37:58Z","snapshot_observed_at":"2026-08-14T17:25:55.995167Z","submitted_at":"2026-07-30T12:37:58Z","title":"Face and Voice Cross-modal Association with Learning Convex Feature Embedding","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-31T16:58:27.430425Z"},"links":{"citing_paper":"/paper/2607.28129"},"observation_digest":"sha256:a78a1b8757558ad82224ace2701d0bf8611df3b9800455e85e973b58385a23f0","observation_id":"10d078a1-8d2f-4ebc-bbc2-cd5e36e967a8","resolution":{"observed_at":"2026-07-31T16:58:27.430425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:58:27.481477Z","title":"IEEE Transactions on Multimedia 22(1), 174–187 (2019)","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.28129","last_updated":"2026-07-30T12:37:58Z","snapshot_observed_at":"2026-08-14T17:25:55.995167Z","submitted_at":"2026-07-30T12:37:58Z","title":"Face and Voice Cross-modal Association with Learning Convex Feature Embedding","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-31T16:58:27.481477Z"},"links":{"citing_paper":"/paper/2607.28129"},"observation_digest":"sha256:7e4ca60203002cfaa01c113d5afbd0ccfd7e9206e2cb032a737b2a4cccf47be0","observation_id":"e60576c8-c32e-4740-bc10-e22802b0d7b0","resolution":{"observed_at":"2026-07-31T16:58:27.481477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:58:27.524595Z","title":"IEEE Transactions on Multimedia 21(5), 1276–1288 (2018)","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.28129","last_updated":"2026-07-30T12:37:58Z","snapshot_observed_at":"2026-08-14T17:25:55.995167Z","submitted_at":"2026-07-30T12:37:58Z","title":"Face and Voice Cross-modal Association with Learning Convex Feature Embedding","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-31T16:58:27.524595Z"},"links":{"citing_paper":"/paper/2607.28129"},"observation_digest":"sha256:6fee1bea3e7ecf0fd699835bc3bd9e9678486e016bc6dd53f76da28fb5f13b82","observation_id":"f238620a-134f-483b-a26b-cafbd56bc09d","resolution":{"observed_at":"2026-07-31T16:58:27.524595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:58:27.581736Z","title":"IEEE Transactions on Multimedia 21(5), 1261–1275 (2018)","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.28129","last_updated":"2026-07-30T12:37:58Z","snapshot_observed_at":"2026-08-14T17:25:55.995167Z","submitted_at":"2026-07-30T12:37:58Z","title":"Face and Voice Cross-modal Association with Learning Convex Feature Embedding","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-31T16:58:27.581736Z"},"links":{"citing_paper":"/paper/2607.28129"},"observation_digest":"sha256:0db10a076ea7a4118f9cb0cff8224c1ccacd2dbc9a692d200e60975568595805","observation_id":"0ae5b143-935e-4f13-bdc2-1faf615feab1","resolution":{"observed_at":"2026-07-31T16:58:27.581736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:58:27.631664Z","title":"IEEE Transactions on Cybernetics 50(6), 2400–2413 (2019)","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.28129","last_updated":"2026-07-30T12:37:58Z","snapshot_observed_at":"2026-08-14T17:25:55.995167Z","submitted_at":"2026-07-30T12:37:58Z","title":"Face and Voice Cross-modal Association with Learning Convex Feature Embedding","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-31T16:58:27.631664Z"},"links":{"citing_paper":"/paper/2607.28129"},"observation_digest":"sha256:2528ef23e40aa412d9c51922e2bcd45cf395c916e4c4b1186112058f8eecd474","observation_id":"a123b562-ecf8-4191-9d19-3701a13a289f","resolution":{"observed_at":"2026-07-31T16:58:27.631664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:58:27.722740Z","title":"IEEE Transactions on Circuits and Systems for Video Technology 30(4), 1173–1187 (2019)","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.28129","last_updated":"2026-07-30T12:37:58Z","snapshot_observed_at":"2026-08-14T17:25:55.995167Z","submitted_at":"2026-07-30T12:37:58Z","title":"Face and Voice Cross-modal Association with Learning Convex Feature Embedding","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-31T16:58:27.722740Z"},"links":{"citing_paper":"/paper/2607.28129"},"observation_digest":"sha256:76def41413684bad7377618be4ab3bd2ded6ab938bef28eeb2603a74bf7b5048","observation_id":"8cf46754-5e4c-448f-821c-a466feb1d0c0","resolution":{"observed_at":"2026-07-31T16:58:27.722740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:58:27.767518Z","title":"In: Proceedings of the International Conference on Multimedia Retrieval, pp","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.28129","last_updated":"2026-07-30T12:37:58Z","snapshot_observed_at":"2026-08-14T17:25:55.995167Z","submitted_at":"2026-07-30T12:37:58Z","title":"Face and Voice Cross-modal Association with Learning Convex Feature Embedding","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-31T16:58:27.767518Z"},"links":{"citing_paper":"/paper/2607.28129"},"observation_digest":"sha256:81d5ba74f28637fbb251693ccc968ed524e74ec5226b893bf362bc9f3e0a9b19","observation_id":"481fc499-4348-4b6e-ad84-f603b05da8b0","resolution":{"observed_at":"2026-07-31T16:58:27.767518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:58:27.818895Z","title":"In: Lee, D., Sugiyama, M., Luxburg, U., Guyon, I., Garnett, R","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.28129","last_updated":"2026-07-30T12:37:58Z","snapshot_observed_at":"2026-08-14T17:25:55.995167Z","submitted_at":"2026-07-30T12:37:58Z","title":"Face and Voice Cross-modal Association with Learning Convex Feature Embedding","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-31T16:58:27.818895Z"},"links":{"citing_paper":"/paper/2607.28129"},"observation_digest":"sha256:be874a32030014a5431413ed79616a6fca9a88b3c377aa9986b83a13f2c35c8d","observation_id":"fdeacb01-3bc9-47f0-b6bb-02da84cb310d","resolution":{"observed_at":"2026-07-31T16:58:27.818895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:58:27.873474Z","title":"In: Proceedings of the International Conference on Machine Learning, pp","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2607.28129","last_updated":"2026-07-30T12:37:58Z","snapshot_observed_at":"2026-08-14T17:25:55.995167Z","submitted_at":"2026-07-30T12:37:58Z","title":"Face and Voice Cross-modal Association with Learning Convex Feature Embedding","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-31T16:58:27.873474Z"},"links":{"citing_paper":"/paper/2607.28129"},"observation_digest":"sha256:e064483107950e52764b9826abafb4ecdc68dcf662edf61d8e585370a32952f3","observation_id":"a29ca556-1571-42f5-b9c4-fcb272d7329c","resolution":{"observed_at":"2026-07-31T16:58:27.873474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:58:27.909586Z","title":"In: Pereira, F., Burges, C.J., Bottou, L., Weinberger, K.Q","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2607.28129","last_updated":"2026-07-30T12:37:58Z","snapshot_observed_at":"2026-08-14T17:25:55.995167Z","submitted_at":"2026-07-30T12:37:58Z","title":"Face and Voice Cross-modal Association with Learning Convex Feature Embedding","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-07-31T16:58:27.909586Z"},"links":{"citing_paper":"/paper/2607.28129"},"observation_digest":"sha256:c0276a584a67e4838e968e6f7ab7bfe3b185b67ec64bcd8ccb3f6106877fc78b","observation_id":"0877d008-e0f0-4012-a020-9000aae51de0","resolution":{"observed_at":"2026-07-31T16:58:27.909586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:58:27.972938Z","title":"In: Proceedings of the 31st ACM International Conference on Multimedia (ACM MM), pp","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.28129","last_updated":"2026-07-30T12:37:58Z","snapshot_observed_at":"2026-08-14T17:25:55.995167Z","submitted_at":"2026-07-30T12:37:58Z","title":"Face and Voice Cross-modal Association with Learning Convex Feature Embedding","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-07-31T16:58:27.972938Z"},"links":{"citing_paper":"/paper/2607.28129"},"observation_digest":"sha256:330e2921da8d5d28c3b6682ae67b98d38ac0be966955df80de9043a7ca2004a4","observation_id":"4e9023e8-41a5-46c6-9e52-332255ce8b6d","resolution":{"observed_at":"2026-07-31T16:58:27.972938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:58:28.038708Z","title":"IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI) (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28129","last_updated":"2026-07-30T12:37:58Z","snapshot_observed_at":"2026-08-14T17:25:55.995167Z","submitted_at":"2026-07-30T12:37:58Z","title":"Face and Voice Cross-modal Association with Learning Convex Feature Embedding","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-07-31T16:58:28.038708Z"},"links":{"citing_paper":"/paper/2607.28129"},"observation_digest":"sha256:6f78febdec70c8129a5f4e1c05caf009fd3e11c857ad3c999d8206998c8f7fbb","observation_id":"90429342-b41a-4848-876a-44736c6b7d9c","resolution":{"observed_at":"2026-07-31T16:58:28.038708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:58:28.080724Z","title":"International Journal of Automation and Computing 18, 351–376 (2021)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.28129","last_updated":"2026-07-30T12:37:58Z","snapshot_observed_at":"2026-08-14T17:25:55.995167Z","submitted_at":"2026-07-30T12:37:58Z","title":"Face and Voice Cross-modal Association with Learning Convex Feature Embedding","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-07-31T16:58:28.080724Z"},"links":{"citing_paper":"/paper/2607.28129"},"observation_digest":"sha256:c7b1a82f55266ce26372f64efe6f0feb3e3180a17030f4f8ccdf996322b2e0c5","observation_id":"a9497af2-05ea-45b2-b757-476c39c51b56","resolution":{"observed_at":"2026-07-31T16:58:28.080724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:58:28.138668Z","title":"ACM Transactions on Graphics 33(4), 1–10 (2014)","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2607.28129","last_updated":"2026-07-30T12:37:58Z","snapshot_observed_at":"2026-08-14T17:25:55.995167Z","submitted_at":"2026-07-30T12:37:58Z","title":"Face and Voice Cross-modal Association with Learning Convex Feature Embedding","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-07-31T16:58:28.138668Z"},"links":{"citing_paper":"/paper/2607.28129"},"observation_digest":"sha256:7fe4ee2c361a2922092ffc4ff30d2609a5faa0d63055110685c2b2a9e5a77a88","observation_id":"1eacc94f-d15b-47bb-86c4-d2cdd7071640","resolution":{"observed_at":"2026-07-31T16:58:28.138668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:58:28.195910Z","title":"In: Proceedings of the IEEE International Conference on Acoustics, Speech and Signal Processing, pp","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.28129","last_updated":"2026-07-30T12:37:58Z","snapshot_observed_at":"2026-08-14T17:25:55.995167Z","submitted_at":"2026-07-30T12:37:58Z","title":"Face and Voice Cross-modal Association with Learning Convex Feature Embedding","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-07-31T16:58:28.195910Z"},"links":{"citing_paper":"/paper/2607.28129"},"observation_digest":"sha256:37b6cac153a571d32dd064dd822288a85e19d060fda9befbddfee323ec3531aa","observation_id":"16378954-c10a-4a87-a98e-8de6cb960e73","resolution":{"observed_at":"2026-07-31T16:58:28.195910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:58:28.254956Z","title":"In: Proceedings of the on Thematic Workshops of ACM Multimedia, pp","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.28129","last_updated":"2026-07-30T12:37:58Z","snapshot_observed_at":"2026-08-14T17:25:55.995167Z","submitted_at":"2026-07-30T12:37:58Z","title":"Face and Voice Cross-modal Association with Learning Convex Feature Embedding","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-07-31T16:58:28.254956Z"},"links":{"citing_paper":"/paper/2607.28129"},"observation_digest":"sha256:8c10ec707315a07e575098c08cd71e1c8ab400428b4733f2dc78608b452083cf","observation_id":"b4bc5d68-320d-4c0b-8097-c863f8da3945","resolution":{"observed_at":"2026-07-31T16:58:28.254956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:58:28.308730Z","title":"In: Proceedings of the AAAI Conference on Artificial Intelligence, pp","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.28129","last_updated":"2026-07-30T12:37:58Z","snapshot_observed_at":"2026-08-14T17:25:55.995167Z","submitted_at":"2026-07-30T12:37:58Z","title":"Face and Voice Cross-modal Association with Learning Convex Feature Embedding","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-07-31T16:58:28.308730Z"},"links":{"citing_paper":"/paper/2607.28129"},"observation_digest":"sha256:53c80428b65eda5538badbda0e2455755ddfadccd6bb957e61b587cb8d309927","observation_id":"96f55cb2-22c6-424e-ad5a-dba36058641b","resolution":{"observed_at":"2026-07-31T16:58:28.308730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:58:28.387837Z","title":"In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.28129","last_updated":"2026-07-30T12:37:58Z","snapshot_observed_at":"2026-08-14T17:25:55.995167Z","submitted_at":"2026-07-30T12:37:58Z","title":"Face and Voice Cross-modal Association with Learning Convex Feature Embedding","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-07-31T16:58:28.387837Z"},"links":{"citing_paper":"/paper/2607.28129"},"observation_digest":"sha256:3510cdb14240aef314b722d98034a54fc17bbc7a8d988749574150e804e3220a","observation_id":"a2f1d6f5-6361-429c-b0eb-303fef713d79","resolution":{"observed_at":"2026-07-31T16:58:28.387837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:58:28.452806Z","title":"In: Proceedings of the INTERSPEECH 2015, pp","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.28129","last_updated":"2026-07-30T12:37:58Z","snapshot_observed_at":"2026-08-14T17:25:55.995167Z","submitted_at":"2026-07-30T12:37:58Z","title":"Face and Voice Cross-modal Association with Learning Convex Feature Embedding","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-07-31T16:58:28.452806Z"},"links":{"citing_paper":"/paper/2607.28129"},"observation_digest":"sha256:2f4541f143b57c5aa3a265bc6fefb56d3180037ccc40a0eb789d4f42b39881ce","observation_id":"03ad3584-e503-464e-9d04-1e1852e48471","resolution":{"observed_at":"2026-07-31T16:58:28.452806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:58:28.538446Z","title":"IEEE/ACM Transactions on Audio, Speech, and Language Processing 25(9), 1751–1761 (2017)","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.28129","last_updated":"2026-07-30T12:37:58Z","snapshot_observed_at":"2026-08-14T17:25:55.995167Z","submitted_at":"2026-07-30T12:37:58Z","title":"Face and Voice Cross-modal Association with Learning Convex Feature Embedding","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-07-31T16:58:28.538446Z"},"links":{"citing_paper":"/paper/2607.28129"},"observation_digest":"sha256:bbad89410781d09c3d2de317aee4c78542639b5bc7bf12b500eb7f15f11f8940","observation_id":"b87d79fc-f992-4054-a03f-790245ce3682","resolution":{"observed_at":"2026-07-31T16:58:28.538446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:58:28.586553Z","title":"In: Solla, S., Leen, T., M¨ uller, K","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2607.28129","last_updated":"2026-07-30T12:37:58Z","snapshot_observed_at":"2026-08-14T17:25:55.995167Z","submitted_at":"2026-07-30T12:37:58Z","title":"Face and Voice Cross-modal Association with Learning Convex Feature Embedding","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-07-31T16:58:28.586553Z"},"links":{"citing_paper":"/paper/2607.28129"},"observation_digest":"sha256:744c7cb722a521c8b072fd70a1c57b2297915e0b27f04b8ed541781b50fb923a","observation_id":"2cc7ad02-04a8-44cc-9fbf-0452a57228ce","resolution":{"observed_at":"2026-07-31T16:58:28.586553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:58:28.666612Z","title":"In: Proceedings of the European Conference on Computer Vision, 31 pp","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.28129","last_updated":"2026-07-30T12:37:58Z","snapshot_observed_at":"2026-08-14T17:25:55.995167Z","submitted_at":"2026-07-30T12:37:58Z","title":"Face and Voice Cross-modal Association with Learning Convex Feature Embedding","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-07-31T16:58:28.666612Z"},"links":{"citing_paper":"/paper/2607.28129"},"observation_digest":"sha256:500f7436babf4ec3b3b32b68a0277d1f189db91cd8048b70f20b918c683deed9","observation_id":"344990df-d75d-420a-aeab-12210c24b2d8","resolution":{"observed_at":"2026-07-31T16:58:28.666612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:58:28.714294Z","title":"In: Proceedings of the IEEE Conference on Com- puter Vision and Pattern Recognition, pp","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.28129","last_updated":"2026-07-30T12:37:58Z","snapshot_observed_at":"2026-08-14T17:25:55.995167Z","submitted_at":"2026-07-30T12:37:58Z","title":"Face and Voice Cross-modal Association with Learning Convex Feature Embedding","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-07-31T16:58:28.714294Z"},"links":{"citing_paper":"/paper/2607.28129"},"observation_digest":"sha256:f8c94f447be092bd38c11836db0f382d4f6cb318cc2a015e81f3022b04dfc8fa","observation_id":"47f8481d-0ec2-4f30-ace2-7bd54df56ebf","resolution":{"observed_at":"2026-07-31T16:58:28.714294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:58:28.794856Z","title":"In: Proceedings of the European Conference on Computer Vision, pp","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.28129","last_updated":"2026-07-30T12:37:58Z","snapshot_observed_at":"2026-08-14T17:25:55.995167Z","submitted_at":"2026-07-30T12:37:58Z","title":"Face and Voice Cross-modal Association with Learning Convex Feature Embedding","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-07-31T16:58:28.794856Z"},"links":{"citing_paper":"/paper/2607.28129"},"observation_digest":"sha256:24e21fead3acf27ae606f35cedc00b75e042f3388ec69d0722c75d507a2cae66","observation_id":"be67a824-b174-4e99-a93d-663c571afab8","resolution":{"observed_at":"2026-07-31T16:58:28.794856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:58:28.875490Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshop, pp","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.28129","last_updated":"2026-07-30T12:37:58Z","snapshot_observed_at":"2026-08-14T17:25:55.995167Z","submitted_at":"2026-07-30T12:37:58Z","title":"Face and Voice Cross-modal Association with Learning Convex Feature Embedding","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-07-31T16:58:28.875490Z"},"links":{"citing_paper":"/paper/2607.28129"},"observation_digest":"sha256:f7c23eb9ced3245258abe1c4df2b7aabba6ab6d31001760160b808fcfc298c3b","observation_id":"57d0a1df-7996-4397-886e-88f27dc7d150","resolution":{"observed_at":"2026-07-31T16:58:28.875490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:58:28.923675Z","title":"In: Proceedings of the INTERSPEECH 2020, pp","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.28129","last_updated":"2026-07-30T12:37:58Z","snapshot_observed_at":"2026-08-14T17:25:55.995167Z","submitted_at":"2026-07-30T12:37:58Z","title":"Face and Voice Cross-modal Association with Learning Convex Feature Embedding","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-07-31T16:58:28.923675Z"},"links":{"citing_paper":"/paper/2607.28129"},"observation_digest":"sha256:fe22593f684a0dc28bdbfcf4fe7cad5cfffb2be312bef92c259d2f5d0173656d","observation_id":"74335418-9b91-4e92-b245-ab9f0b21fd9d","resolution":{"observed_at":"2026-07-31T16:58:28.923675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:58:29.046813Z","title":"In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.28129","last_updated":"2026-07-30T12:37:58Z","snapshot_observed_at":"2026-08-14T17:25:55.995167Z","submitted_at":"2026-07-30T12:37:58Z","title":"Face and Voice Cross-modal Association with Learning Convex Feature Embedding","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-07-31T16:58:29.046813Z"},"links":{"citing_paper":"/paper/2607.28129"},"observation_digest":"sha256:4a0e7b2e48dc0dd66757be989030acb6411a70acaa0aa4e32e27110987b72de1","observation_id":"cf384ede-5b93-4b6a-b50d-852526001449","resolution":{"observed_at":"2026-07-31T16:58:29.046813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:58:29.091834Z","title":"IEEE Transactions on Multimedia 24, 338–351 (2021)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.28129","last_updated":"2026-07-30T12:37:58Z","snapshot_observed_at":"2026-08-14T17:25:55.995167Z","submitted_at":"2026-07-30T12:37:58Z","title":"Face and Voice Cross-modal Association with Learning Convex Feature Embedding","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-07-31T16:58:29.091834Z"},"links":{"citing_paper":"/paper/2607.28129"},"observation_digest":"sha256:f429cf4a58918248ad330608e86cf72b1e5b132cf5b507a21f7dbdab5506ad1d","observation_id":"dcacc1ab-5178-472c-802c-4083479c862e","resolution":{"observed_at":"2026-07-31T16:58:29.091834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:58:29.148404Z","title":"In: Proceedings of the IEEE International Conference on Automatic Face & Gesture Recognition, pp","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.28129","last_updated":"2026-07-30T12:37:58Z","snapshot_observed_at":"2026-08-14T17:25:55.995167Z","submitted_at":"2026-07-30T12:37:58Z","title":"Face and Voice Cross-modal Association with Learning Convex Feature Embedding","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-07-31T16:58:29.148404Z"},"links":{"citing_paper":"/paper/2607.28129"},"observation_digest":"sha256:a10f2eacb33661b2a23f504c2c72eb77664e6d78fe480b914ac0b344fd50dc86","observation_id":"bd3112c0-e0fa-404d-92e9-19fd8219f78e","resolution":{"observed_at":"2026-07-31T16:58:29.148404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:58:29.215579Z","title":"In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.28129","last_updated":"2026-07-30T12:37:58Z","snapshot_observed_at":"2026-08-14T17:25:55.995167Z","submitted_at":"2026-07-30T12:37:58Z","title":"Face and Voice Cross-modal Association with Learning Convex Feature Embedding","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-07-31T16:58:29.215579Z"},"links":{"citing_paper":"/paper/2607.28129"},"observation_digest":"sha256:f7b730efd63c3c344a547183a7bff1fb6b0fb87adf5637a1839596d81a0b920e","observation_id":"5f144e9d-dcdb-4086-a8ef-4459518ec5f2","resolution":{"observed_at":"2026-07-31T16:58:29.215579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:58:29.268988Z","title":"In: Proceedings of the British Machine Vision Conference, pp","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.28129","last_updated":"2026-07-30T12:37:58Z","snapshot_observed_at":"2026-08-14T17:25:55.995167Z","submitted_at":"2026-07-30T12:37:58Z","title":"Face and Voice Cross-modal Association with Learning Convex Feature Embedding","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-07-31T16:58:29.268988Z"},"links":{"citing_paper":"/paper/2607.28129"},"observation_digest":"sha256:dbfae5263de255a89f019da22c08d754da6c3b37ce10fb98a7049c0fabc523d7","observation_id":"135a255c-ad85-4370-b14a-71d52a795d51","resolution":{"observed_at":"2026-07-31T16:58:29.268988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.04624","last_updated":"2021-06-08T18:22:56Z","snapshot_observed_at":"2026-08-14T05:20:02.331354Z","submitted_at":"2021-06-08T18:22:56Z","title":"SpeechBrain: A General-Purpose Speech Toolkit","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.04624","snapshot_observed_at":"2026-07-31T16:58:29.335057Z","title":"arXiv (2021)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.28129","last_updated":"2026-07-30T12:37:58Z","snapshot_observed_at":"2026-08-14T17:25:55.995167Z","submitted_at":"2026-07-30T12:37:58Z","title":"Face and Voice Cross-modal Association with Learning Convex Feature Embedding","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-07-31T16:58:29.335057Z"},"links":{"cited_paper":"/paper/2106.04624","citing_paper":"/paper/2607.28129"},"observation_digest":"sha256:f8e928a9cd9e506e76dcf6774f5ec5924474403a8f632e9d01ac1dc08a0f3d4b","observation_id":"d5a6f97a-d528-47aa-9b47-c52229f6fb69","resolution":{"observed_at":"2026-07-31T16:58:29.335057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:58:29.399326Z","title":"In: Proceedings of the INTERSPEECH 2020, pp","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.28129","last_updated":"2026-07-30T12:37:58Z","snapshot_observed_at":"2026-08-14T17:25:55.995167Z","submitted_at":"2026-07-30T12:37:58Z","title":"Face and Voice Cross-modal Association with Learning Convex Feature Embedding","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-07-31T16:58:29.399326Z"},"links":{"citing_paper":"/paper/2607.28129"},"observation_digest":"sha256:091a880ee1fc2e41999b22e3e46422c6b6978e6e774089bee1c9269061703007","observation_id":"d150f3a2-b989-4649-bcf3-0ad7b3cb880e","resolution":{"observed_at":"2026-07-31T16:58:29.399326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:58:29.443788Z","title":"In: Proceedings of the IEEE International Conference on Acoustics, Speech and Signal Processing, pp","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.28129","last_updated":"2026-07-30T12:37:58Z","snapshot_observed_at":"2026-08-14T17:25:55.995167Z","submitted_at":"2026-07-30T12:37:58Z","title":"Face and Voice Cross-modal Association with Learning Convex Feature Embedding","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-07-31T16:58:29.443788Z"},"links":{"citing_paper":"/paper/2607.28129"},"observation_digest":"sha256:ad06bbfae73626b36abfc16aa2e5f12fa8c4e4e856b8e1bd2030ca6a7c2740b5","observation_id":"ed77f05b-6b45-47a7-b8f5-1f1f6e7104d1","resolution":{"observed_at":"2026-07-31T16:58:29.443788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:58:29.505602Z","title":"In: Proceedings of the INTERSPEECH 2018, pp","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.28129","last_updated":"2026-07-30T12:37:58Z","snapshot_observed_at":"2026-08-14T17:25:55.995167Z","submitted_at":"2026-07-30T12:37:58Z","title":"Face and Voice Cross-modal Association with Learning Convex Feature Embedding","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-07-31T16:58:29.505602Z"},"links":{"citing_paper":"/paper/2607.28129"},"observation_digest":"sha256:7ac97bff3f90af93308b8e352e1f5768bf002a90e86bba17067ffaf365c55477","observation_id":"01b9fa9a-086f-488a-b814-9d44cf3200e6","resolution":{"observed_at":"2026-07-31T16:58:29.505602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2008.09164","last_updated":"2020-08-20T19:08:56Z","snapshot_observed_at":"2026-08-12T11:07:33.427213Z","submitted_at":"2020-08-20T19:08:56Z","title":"PyTorch Metric Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2008.09164","snapshot_observed_at":"2026-07-31T16:58:29.563080Z","title":"arXiv (2020)","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.28129","last_updated":"2026-07-30T12:37:58Z","snapshot_observed_at":"2026-08-14T17:25:55.995167Z","submitted_at":"2026-07-30T12:37:58Z","title":"Face and Voice Cross-modal Association with Learning Convex Feature Embedding","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-07-31T16:58:29.563080Z"},"links":{"cited_paper":"/paper/2008.09164","citing_paper":"/paper/2607.28129"},"observation_digest":"sha256:3e7c837ab175f3c93b37938b00fe98a2dc77c026a07146698eb9ac7ca5258499","observation_id":"ab3bfeb2-3942-465c-aa5a-b6d13b2b08b6","resolution":{"observed_at":"2026-07-31T16:58:29.563080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:58:29.601252Z","title":"In: Wallach, H., Larochelle, H., Beygelzimer, A., Alch´ e-Buc, F., Fox, E., Garnett, R","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.28129","last_updated":"2026-07-30T12:37:58Z","snapshot_observed_at":"2026-08-14T17:25:55.995167Z","submitted_at":"2026-07-30T12:37:58Z","title":"Face and Voice Cross-modal Association with Learning Convex Feature Embedding","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-07-31T16:58:29.601252Z"},"links":{"citing_paper":"/paper/2607.28129"},"observation_digest":"sha256:6e0256bd4946f1a80a9c777decbf3a17a6a4b8213ce508657690e0033c5e7acf","observation_id":"065f252c-e1ba-4f33-94ed-5c1d03c6a99d","resolution":{"observed_at":"2026-07-31T16:58:29.601252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-08-14T18:51:16.666127Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-07-31T16:58:29.661809Z","title":"arXiv (2014)","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2607.28129","last_updated":"2026-07-30T12:37:58Z","snapshot_observed_at":"2026-08-14T17:25:55.995167Z","submitted_at":"2026-07-30T12:37:58Z","title":"Face and Voice Cross-modal Association with Learning Convex Feature Embedding","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-07-31T16:58:29.661809Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2607.28129"},"observation_digest":"sha256:205e90d66088cd41bfe9372b6b83afec520b8ed6dc356ba1859b24064d5e2790","observation_id":"413295ae-7846-409a-aea8-70c6f2a18610","resolution":{"observed_at":"2026-07-31T16:58:29.661809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:58:29.674849Z","title":"Pattern Recognition Letters27(8), 861–874 (2006)","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2607.28129","last_updated":"2026-07-30T12:37:58Z","snapshot_observed_at":"2026-08-14T17:25:55.995167Z","submitted_at":"2026-07-30T12:37:58Z","title":"Face and Voice Cross-modal Association with Learning Convex Feature Embedding","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-07-31T16:58:29.674849Z"},"links":{"citing_paper":"/paper/2607.28129"},"observation_digest":"sha256:a84711ef8e930ae3d8c7ecf8ae956d4c5a19a7181b7d739c680ff592cab61e46","observation_id":"2a57fe69-62ea-4f9e-8c36-ab7e46778553","resolution":{"observed_at":"2026-07-31T16:58:29.674849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:58:29.761491Z","title":"In: Proceedings of the IEEE International Conference on Computer Vision (ICCV), pp","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.28129","last_updated":"2026-07-30T12:37:58Z","snapshot_observed_at":"2026-08-14T17:25:55.995167Z","submitted_at":"2026-07-30T12:37:58Z","title":"Face and Voice Cross-modal Association with Learning Convex Feature Embedding","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-07-31T16:58:29.761491Z"},"links":{"citing_paper":"/paper/2607.28129"},"observation_digest":"sha256:2c861c7605104004e657c869a3ca63b100a8fbbab9a9cec20a78f93a1ef84b00","observation_id":"c798ed7b-f6c0-41e8-9964-1cb74a301691","resolution":{"observed_at":"2026-07-31T16:58:29.761491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:58:29.807485Z","title":"In: Proceedings of the IEEE Conference on Com- puter Vision and Pattern Recognition, pp","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.28129","last_updated":"2026-07-30T12:37:58Z","snapshot_observed_at":"2026-08-14T17:25:55.995167Z","submitted_at":"2026-07-30T12:37:58Z","title":"Face and Voice Cross-modal Association with Learning Convex Feature Embedding","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-07-31T16:58:29.807485Z"},"links":{"citing_paper":"/paper/2607.28129"},"observation_digest":"sha256:30f3cf868fd1df02e86cabdc2bebc052790fe9cfe969d51951a06a2959f7faa8","observation_id":"82a91f7e-1353-48bc-9bf5-16cfb3ec2e51","resolution":{"observed_at":"2026-07-31T16:58:29.807485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:58:29.841532Z","title":"In: Proceedings of the European Conference on Computer Vision, pp","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.28129","last_updated":"2026-07-30T12:37:58Z","snapshot_observed_at":"2026-08-14T17:25:55.995167Z","submitted_at":"2026-07-30T12:37:58Z","title":"Face and Voice Cross-modal Association with Learning Convex Feature Embedding","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-07-31T16:58:29.841532Z"},"links":{"citing_paper":"/paper/2607.28129"},"observation_digest":"sha256:1cbb85bacf1d6d2071117415ec541a494af8bdb71fc052d375cd88bbf490595a","observation_id":"10536cf4-1405-407b-91e7-c82b55cc894a","resolution":{"observed_at":"2026-07-31T16:58:29.841532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:58:29.888356Z","title":"Journal of Machine Learning Research 9(11), 2579–2605 (2008)","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2607.28129","last_updated":"2026-07-30T12:37:58Z","snapshot_observed_at":"2026-08-14T17:25:55.995167Z","submitted_at":"2026-07-30T12:37:58Z","title":"Face and Voice Cross-modal Association with Learning Convex Feature Embedding","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-07-31T16:58:29.888356Z"},"links":{"citing_paper":"/paper/2607.28129"},"observation_digest":"sha256:0c338b41c3b5a7b277525864c73de2616bdcc1c816bad74b5b23243d4e726e24","observation_id":"4b99046c-a7a4-4af9-9dbb-10eea0ff9c15","resolution":{"observed_at":"2026-07-31T16:58:29.888356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:58:29.918790Z","title":"Journal of the American Mathematical Society 29(4), 983–1049 (2016)","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.28129","last_updated":"2026-07-30T12:37:58Z","snapshot_observed_at":"2026-08-14T17:25:55.995167Z","submitted_at":"2026-07-30T12:37:58Z","title":"Face and Voice Cross-modal Association with Learning Convex Feature Embedding","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-07-31T16:58:29.918790Z"},"links":{"citing_paper":"/paper/2607.28129"},"observation_digest":"sha256:d922e20857d20d66b029496cf69ca7536a220f554fcbcac055f1e507d04ab5c4","observation_id":"c59772c7-480f-4f29-a1ed-a598f5d0b389","resolution":{"observed_at":"2026-07-31T16:58:29.918790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:58:30.016407Z","title":"International Conference on Machine Learning (ICML), 9929–9939 (2020)","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.28129","last_updated":"2026-07-30T12:37:58Z","snapshot_observed_at":"2026-08-14T17:25:55.995167Z","submitted_at":"2026-07-30T12:37:58Z","title":"Face and Voice Cross-modal Association with Learning Convex Feature Embedding","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-07-31T16:58:30.016407Z"},"links":{"citing_paper":"/paper/2607.28129"},"observation_digest":"sha256:504c971d3ec3d20c42b1bdbb561921518891a1538edcb5158469a48dd1489e8b","observation_id":"5faf1b5a-4c3c-462b-bd37-fd4a5a496fb6","resolution":{"observed_at":"2026-07-31T16:58:30.016407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-08-14T18:53:38.574749Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-07-31T16:58:30.089721Z","title":"arXiv preprint arXiv:1807.03748 (2018)","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.28129","last_updated":"2026-07-30T12:37:58Z","snapshot_observed_at":"2026-08-14T17:25:55.995167Z","submitted_at":"2026-07-30T12:37:58Z","title":"Face and Voice Cross-modal Association with Learning Convex Feature Embedding","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-07-31T16:58:30.089721Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2607.28129"},"observation_digest":"sha256:aa1b4c1c372503b7100c040f469fb53fe117d5a3c7f1a4a00114b58004f6c482","observation_id":"783dd4bb-6434-4766-b458-734bd6b800f8","resolution":{"observed_at":"2026-07-31T16:58:30.089721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:58:30.197617Z","title":"ACM Transactions on Graphics 37(4), 1–11 (2018)","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.28129","last_updated":"2026-07-30T12:37:58Z","snapshot_observed_at":"2026-08-14T17:25:55.995167Z","submitted_at":"2026-07-30T12:37:58Z","title":"Face and Voice Cross-modal Association with Learning Convex Feature Embedding","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-07-31T16:58:30.197617Z"},"links":{"citing_paper":"/paper/2607.28129"},"observation_digest":"sha256:5d6532ed177b450f51fd9e21b8340f36b1d8716a790764eaa7b978ba6f16811b","observation_id":"20738345-916b-4dc9-9a4a-bbce0f1daebf","resolution":{"observed_at":"2026-07-31T16:58:30.197617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:58:30.367314Z","title":"In: IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), pp","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.28129","last_updated":"2026-07-30T12:37:58Z","snapshot_observed_at":"2026-08-14T17:25:55.995167Z","submitted_at":"2026-07-30T12:37:58Z","title":"Face and Voice Cross-modal Association with Learning Convex Feature Embedding","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-07-31T16:58:30.367314Z"},"links":{"citing_paper":"/paper/2607.28129"},"observation_digest":"sha256:4ed5ce7107d33937ce78109a95464fec50aeef73c43ca6210a8e66682d81cafa","observation_id":"104e9aed-b759-4267-b8e4-603769898ad0","resolution":{"observed_at":"2026-07-31T16:58:30.367314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:58:28.974016Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.28129","last_updated":"2026-07-30T12:37:58Z","snapshot_observed_at":"2026-08-14T17:25:55.995167Z","submitted_at":"2026-07-30T12:37:58Z","title":"Face and Voice Cross-modal Association with Learning Convex Feature Embedding","version":1},"reference_index":2246,"source":"pdf_text","source_observed_at":"2026-07-31T16:58:28.974016Z"},"links":{"citing_paper":"/paper/2607.28129"},"observation_digest":"sha256:f4f67d27ca6991c1c3e67eb80948dcdf5117565bfafb76c8eba96d1ce15ef51d","observation_id":"18fd576c-5f0d-4684-a7cd-8df7c36be102","resolution":{"observed_at":"2026-07-31T16:58:28.974016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.28129","last_updated":"2026-07-30T12:37:58Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-14T17:25:55.995167Z","submitted_at":"2026-07-30T12:37:58Z","title":"Face and Voice Cross-modal Association with Learning Convex Feature Embedding"},"reference_resolution":{"displayed":91,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":89,"verified_exact":2,"verified_fuzzy":0},"total_outbound_references":91},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 91 of 91 outbound references and 0 inbound Pith citation observations for arXiv:2607.28129."}