{"as_of":"2026-08-16T19:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ced79ccec5254874f311ef5b2d5d61db29a61ee5b5f0c3e05032554e7c377711","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T23:55:36.165878Z","state":"measured"},{"denominator":41,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":41,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.03532/citation-record","integrity":"/paper/2505.03532/integrity","json":"/paper/2505.03532/citation-record.json","paper":"/paper/2505.03532"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:55:36.596576Z","title":"Multi-modal sentiment analysis based on image and text fusion based on cross-attention mechanism,","venue":null,"work_id":"15d5e190-9814-46de-8737-4ed14d43c274","year":2024},"citing_paper":{"arxiv_id":"2505.03532","last_updated":"2025-05-06T13:41:31Z","snapshot_observed_at":"2026-08-15T23:46:54.687560Z","submitted_at":"2025-05-06T13:41:31Z","title":"Joint Generalized Cosine Similarity: A Novel Method for N-Modal Semantic Alignment Based on Contrastive Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T23:55:36.012895Z"},"links":{"citing_paper":"/paper/2505.03532"},"observation_digest":"sha256:2d7ddcf7a5c501dedbf7e020e70db844c45879da14fbe93850dacf84c34d6303","observation_id":"14081640-e9e1-4943-805d-f85a73827acc","resolution":{"observed_at":"2026-08-15T23:55:36.601052Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:55:36.584801Z","title":"An image-text sentiment analysis method using multi-channel multi-modal joint learning,","venue":null,"work_id":"25f7b21e-4a44-4cee-bafa-f57b1d371544","year":2024},"citing_paper":{"arxiv_id":"2505.03532","last_updated":"2025-05-06T13:41:31Z","snapshot_observed_at":"2026-08-15T23:46:54.687560Z","submitted_at":"2025-05-06T13:41:31Z","title":"Joint Generalized Cosine Similarity: A Novel Method for N-Modal Semantic Alignment Based on Contrastive Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T23:55:36.017521Z"},"links":{"citing_paper":"/paper/2505.03532"},"observation_digest":"sha256:16fb03be26f84a5676d58941d464e68e448b759b6ce0b72a1d6649eef4772799","observation_id":"c539aff7-0d8b-41a2-93a4-a0c0f7c32a69","resolution":{"observed_at":"2026-08-15T23:55:36.588713Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:55:36.572328Z","title":"Unified cross-modal attention: robust audio-visual speech recognition and beyond,","venue":null,"work_id":"cf4f63fb-85d3-4e8f-a86f-22605af046f0","year":1941},"citing_paper":{"arxiv_id":"2505.03532","last_updated":"2025-05-06T13:41:31Z","snapshot_observed_at":"2026-08-15T23:46:54.687560Z","submitted_at":"2025-05-06T13:41:31Z","title":"Joint Generalized Cosine Similarity: A Novel Method for N-Modal Semantic Alignment Based on Contrastive Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T23:55:36.021880Z"},"links":{"citing_paper":"/paper/2505.03532"},"observation_digest":"sha256:a4801e44b0a6657485ecdbeebeb439286c33c96b1f8d1a925847946d50d46992","observation_id":"937aee48-f130-49a7-8348-69486911e7e8","resolution":{"observed_at":"2026-08-15T23:55:36.576863Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:55:36.560698Z","title":"Catnet: Cross-modal fusion for audio–visual speech recognition,","venue":null,"work_id":"00258d52-93e6-4a21-9880-f3b00ed6c4b2","year":2024},"citing_paper":{"arxiv_id":"2505.03532","last_updated":"2025-05-06T13:41:31Z","snapshot_observed_at":"2026-08-15T23:46:54.687560Z","submitted_at":"2025-05-06T13:41:31Z","title":"Joint Generalized Cosine Similarity: A Novel Method for N-Modal Semantic Alignment Based on Contrastive Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T23:55:36.025836Z"},"links":{"citing_paper":"/paper/2505.03532"},"observation_digest":"sha256:c7883e77d5293038b6308a5f482341c1bdb09682305c864fc84c4adef35744df","observation_id":"5acbf293-6235-4e7c-b581-afe03d619700","resolution":{"observed_at":"2026-08-15T23:55:36.564311Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:55:36.549255Z","title":"Medm2g: Unifying medical multi-modal generation via cross-guided diffusion with visual invariant,","venue":null,"work_id":"5a328afc-34c3-4f8c-90a2-3fd511780417","year":2024},"citing_paper":{"arxiv_id":"2505.03532","last_updated":"2025-05-06T13:41:31Z","snapshot_observed_at":"2026-08-15T23:46:54.687560Z","submitted_at":"2025-05-06T13:41:31Z","title":"Joint Generalized Cosine Similarity: A Novel Method for N-Modal Semantic Alignment Based on Contrastive Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T23:55:36.029748Z"},"links":{"citing_paper":"/paper/2505.03532"},"observation_digest":"sha256:96791324c59cca887c3c7087864a56bee31f6aa464ef7b605c819ee677e38a05","observation_id":"b629805d-56e1-4a80-9687-38f41422a240","resolution":{"observed_at":"2026-08-15T23:55:36.553267Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:55:36.537399Z","title":"A comprehensive review on synergy of multi-modal data and ai technologies in medical diagnosis,","venue":null,"work_id":"af659fab-3250-4044-b80c-bd205125ca0f","year":2024},"citing_paper":{"arxiv_id":"2505.03532","last_updated":"2025-05-06T13:41:31Z","snapshot_observed_at":"2026-08-15T23:46:54.687560Z","submitted_at":"2025-05-06T13:41:31Z","title":"Joint Generalized Cosine Similarity: A Novel Method for N-Modal Semantic Alignment Based on Contrastive Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T23:55:36.033858Z"},"links":{"citing_paper":"/paper/2505.03532"},"observation_digest":"sha256:f28d3aabb7e101e07798a7bf693ab7bd9e112593428f755bea002542aa5d7ef9","observation_id":"6dac3c44-6c0a-40cb-886c-2001a8207085","resolution":{"observed_at":"2026-08-15T23:55:36.541170Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00578","last_updated":"2024-03-31T06:55:12Z","snapshot_observed_at":"2026-08-16T14:04:54.843248Z","submitted_at":"2024-03-31T06:55:12Z","title":"M3D: Advancing 3D Medical Image Analysis with Multi-Modal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00578","snapshot_observed_at":"2026-08-15T23:55:36.037745Z","title":"M3d: Advancing 3d medical image analysis with multi-modal large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.03532","last_updated":"2025-05-06T13:41:31Z","snapshot_observed_at":"2026-08-15T23:46:54.687560Z","submitted_at":"2025-05-06T13:41:31Z","title":"Joint Generalized Cosine Similarity: A Novel Method for N-Modal Semantic Alignment Based on Contrastive Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T23:55:36.037745Z"},"links":{"cited_paper":"/paper/2404.00578","citing_paper":"/paper/2505.03532"},"observation_digest":"sha256:1abce4f4baaf4f62aa72b892ed7aeb8813d6e0e6155acada988135721a212c85","observation_id":"ab5d0953-ae96-403a-a3b1-2556b9ae33fd","resolution":{"observed_at":"2026-08-15T23:55:36.037745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:55:36.041730Z","title":"A review on methods and applications in multimodal deep learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.03532","last_updated":"2025-05-06T13:41:31Z","snapshot_observed_at":"2026-08-15T23:46:54.687560Z","submitted_at":"2025-05-06T13:41:31Z","title":"Joint Generalized Cosine Similarity: A Novel Method for N-Modal Semantic Alignment Based on Contrastive Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T23:55:36.041730Z"},"links":{"citing_paper":"/paper/2505.03532"},"observation_digest":"sha256:75ab07805e8dd1912f6b47a21957239157a591399c3ea0c34390e237883c2ce1","observation_id":"8d334e03-3da7-4afb-ab47-1dfa19d7f495","resolution":{"observed_at":"2026-08-15T23:55:36.041730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:55:36.520904Z","title":"Bimac: Bidirectional multimodal alignment in contrastive learning,","venue":null,"work_id":"9a93deba-00d1-4b62-9a7d-3c758dd8c55a","year":2025},"citing_paper":{"arxiv_id":"2505.03532","last_updated":"2025-05-06T13:41:31Z","snapshot_observed_at":"2026-08-15T23:46:54.687560Z","submitted_at":"2025-05-06T13:41:31Z","title":"Joint Generalized Cosine Similarity: A Novel Method for N-Modal Semantic Alignment Based on Contrastive Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T23:55:36.045391Z"},"links":{"citing_paper":"/paper/2505.03532"},"observation_digest":"sha256:21b7db68b2e528c896ed946622c08b7a9f406bdee673a94beeaa413f319d9e9e","observation_id":"8594c819-3016-41d2-8104-157845f29ee7","resolution":{"observed_at":"2026-08-15T23:55:36.524692Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.07402","last_updated":"2025-03-05T16:48:23Z","snapshot_observed_at":"2026-08-16T13:19:23.445758Z","submitted_at":"2024-09-11T16:42:22Z","title":"What to align in multimodal contrastive learning?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.07402","snapshot_observed_at":"2026-08-15T23:55:36.048970Z","title":"What to align in multimodal contrastive learning?","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.03532","last_updated":"2025-05-06T13:41:31Z","snapshot_observed_at":"2026-08-15T23:46:54.687560Z","submitted_at":"2025-05-06T13:41:31Z","title":"Joint Generalized Cosine Similarity: A Novel Method for N-Modal Semantic Alignment Based on Contrastive Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T23:55:36.048970Z"},"links":{"cited_paper":"/paper/2409.07402","citing_paper":"/paper/2505.03532"},"observation_digest":"sha256:6662255eda719adb37aa8ac07ce41658e18d5910ba1f65253c68658a59daaa61","observation_id":"37edc611-6285-4ffb-8ee1-af4b04a3ad1d","resolution":{"observed_at":"2026-08-15T23:55:36.048970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02055","last_updated":"2024-02-03T06:29:04Z","snapshot_observed_at":"2026-08-16T14:21:55.083630Z","submitted_at":"2024-02-03T06:29:04Z","title":"Variance Alignment Score: A Simple But Tough-to-Beat Data Selection Method for Multimodal Contrastive Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.02055","snapshot_observed_at":"2026-08-15T23:55:36.052892Z","title":"Variance alignment score: A simple but tough-to-beat data selection method for multimodal contrastive learning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.03532","last_updated":"2025-05-06T13:41:31Z","snapshot_observed_at":"2026-08-15T23:46:54.687560Z","submitted_at":"2025-05-06T13:41:31Z","title":"Joint Generalized Cosine Similarity: A Novel Method for N-Modal Semantic Alignment Based on Contrastive Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T23:55:36.052892Z"},"links":{"cited_paper":"/paper/2402.02055","citing_paper":"/paper/2505.03532"},"observation_digest":"sha256:36651e6ec14df7c8135a16d97d60806380ef437996d9ed454d3b005ac6a8d0da","observation_id":"bec2b03c-b48a-4cc0-a6fc-e85f870415c9","resolution":{"observed_at":"2026-08-15T23:55:36.052892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16873","last_updated":"2025-08-19T08:07:30Z","snapshot_observed_at":"2026-08-16T13:49:11.312095Z","submitted_at":"2024-05-27T06:43:12Z","title":"ContrastAlign: Toward Robust BEV Feature Alignment via Contrastive Learning for Multi-Modal 3D Object Detection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16873","snapshot_observed_at":"2026-08-15T23:55:36.057355Z","title":"Contrastalign: Toward robust bev feature alignment via contrastive learning for multi-modal 3d object detection,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.03532","last_updated":"2025-05-06T13:41:31Z","snapshot_observed_at":"2026-08-15T23:46:54.687560Z","submitted_at":"2025-05-06T13:41:31Z","title":"Joint Generalized Cosine Similarity: A Novel Method for N-Modal Semantic Alignment Based on Contrastive Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T23:55:36.057355Z"},"links":{"cited_paper":"/paper/2405.16873","citing_paper":"/paper/2505.03532"},"observation_digest":"sha256:3f99545a786877311072390e7cd53f9714fba8ad94aa33fe6efb4b24bc28752c","observation_id":"32f3971f-3f12-484b-8d94-8aa3b7dda540","resolution":{"observed_at":"2026-08-15T23:55:36.057355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:55:36.510304Z","title":"Mm-fi: Multi-modal non-intrusive 4d human dataset for versatile wireless sensing,","venue":null,"work_id":"f1b77e36-c66c-4993-b1c5-9ba9e159e543","year":2023},"citing_paper":{"arxiv_id":"2505.03532","last_updated":"2025-05-06T13:41:31Z","snapshot_observed_at":"2026-08-15T23:46:54.687560Z","submitted_at":"2025-05-06T13:41:31Z","title":"Joint Generalized Cosine Similarity: A Novel Method for N-Modal Semantic Alignment Based on Contrastive Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T23:55:36.061182Z"},"links":{"citing_paper":"/paper/2505.03532"},"observation_digest":"sha256:92d090e0e1b2fc5adb3394c6f9ff9c0f2504517b24fbb26abd7b1490f828d2dd","observation_id":"5eb80b7e-98ce-41b1-8645-940ba052b907","resolution":{"observed_at":"2026-08-15T23:55:36.514243Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:55:36.496305Z","title":"M5product: Self-harmonized contrastive learning for e-commercial multi-modal pretraining,","venue":null,"work_id":"f1d5442f-4f84-46e7-8fdb-33c593318241","year":2022},"citing_paper":{"arxiv_id":"2505.03532","last_updated":"2025-05-06T13:41:31Z","snapshot_observed_at":"2026-08-15T23:46:54.687560Z","submitted_at":"2025-05-06T13:41:31Z","title":"Joint Generalized Cosine Similarity: A Novel Method for N-Modal Semantic Alignment Based on Contrastive Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T23:55:36.065024Z"},"links":{"citing_paper":"/paper/2505.03532"},"observation_digest":"sha256:55c213dc48bc067b82d2230f05aeaf1c17024c66a53c8e8fb0b67bf870e7a1de","observation_id":"ced00b38-dcd9-4bca-b7b8-4cc257ff7e38","resolution":{"observed_at":"2026-08-15T23:55:36.502514Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:55:36.068734Z","title":"Humman: Multi-modal 4d human dataset for versatile sensing and modeling,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.03532","last_updated":"2025-05-06T13:41:31Z","snapshot_observed_at":"2026-08-15T23:46:54.687560Z","submitted_at":"2025-05-06T13:41:31Z","title":"Joint Generalized Cosine Similarity: A Novel Method for N-Modal Semantic Alignment Based on Contrastive Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T23:55:36.068734Z"},"links":{"citing_paper":"/paper/2505.03532"},"observation_digest":"sha256:4a29c32af5aecb6ce04680cf752dbe305c8e0b3dcc4deee949d1e11d288f74f8","observation_id":"ad377fc2-899b-40f1-8deb-6d38a25d77f0","resolution":{"observed_at":"2026-08-15T23:55:36.068734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.02900","last_updated":"2025-07-10T08:33:52Z","snapshot_observed_at":"2026-08-16T13:28:19.033963Z","submitted_at":"2024-08-06T02:09:35Z","title":"MedTrinity-25M: A Large-scale Multimodal Dataset with Multigranular Annotations for Medicine","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.02900","snapshot_observed_at":"2026-08-15T23:55:36.072451Z","title":"Medtrinity-25m: A large-scale multimodal dataset with multigranular annotations for medicine,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.03532","last_updated":"2025-05-06T13:41:31Z","snapshot_observed_at":"2026-08-15T23:46:54.687560Z","submitted_at":"2025-05-06T13:41:31Z","title":"Joint Generalized Cosine Similarity: A Novel Method for N-Modal Semantic Alignment Based on Contrastive Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T23:55:36.072451Z"},"links":{"cited_paper":"/paper/2408.02900","citing_paper":"/paper/2505.03532"},"observation_digest":"sha256:f33401fa50091ba09ff1d401bff941cb4600b302413ffb0ea48cb14db506c011","observation_id":"aeb73310-18a3-4bf4-8532-2d37fae37aa8","resolution":{"observed_at":"2026-08-15T23:55:36.072451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:55:36.476866Z","title":"Mmearth: Exploring multi-modal pretext tasks for geospatial representation learning,","venue":null,"work_id":"69c8d43b-d6da-4d84-b603-ff8147fd316e","year":2024},"citing_paper":{"arxiv_id":"2505.03532","last_updated":"2025-05-06T13:41:31Z","snapshot_observed_at":"2026-08-15T23:46:54.687560Z","submitted_at":"2025-05-06T13:41:31Z","title":"Joint Generalized Cosine Similarity: A Novel Method for N-Modal Semantic Alignment Based on Contrastive Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T23:55:36.076573Z"},"links":{"citing_paper":"/paper/2505.03532"},"observation_digest":"sha256:219f795ef0d43be792ac1b0f0612d553d041bebc9282dec8386efa822b3c7aba","observation_id":"86f0b9cd-c5ae-4771-ba03-bc3037a479ed","resolution":{"observed_at":"2026-08-15T23:55:36.480900Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:55:36.465585Z","title":"Gen-jema: enhanced explainability using generative joint embedding multimodal alignment for monitoring directed energy deposition,","venue":null,"work_id":"6fe3b6f4-a2f2-4b1e-a035-e02c188f305a","year":2025},"citing_paper":{"arxiv_id":"2505.03532","last_updated":"2025-05-06T13:41:31Z","snapshot_observed_at":"2026-08-15T23:46:54.687560Z","submitted_at":"2025-05-06T13:41:31Z","title":"Joint Generalized Cosine Similarity: A Novel Method for N-Modal Semantic Alignment Based on Contrastive Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T23:55:36.080481Z"},"links":{"citing_paper":"/paper/2505.03532"},"observation_digest":"sha256:5e80c6db6f748666153c9f02dbf46d683c5e783275bd1d70b7ab31964b2e2a04","observation_id":"e7841f29-3a69-420b-960a-cd75f4bf0b07","resolution":{"observed_at":"2026-08-15T23:55:36.469463Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.05612","last_updated":"2018-07-29T19:11:57Z","snapshot_observed_at":"2026-08-14T20:46:56.185352Z","submitted_at":"2017-07-18T13:51:32Z","title":"VSE++: Improving Visual-Semantic Embeddings with Hard Negatives","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.05612","snapshot_observed_at":"2026-08-15T23:55:36.084315Z","title":"Vse++: Improv- ing visual-semantic embeddings with hard negatives,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.03532","last_updated":"2025-05-06T13:41:31Z","snapshot_observed_at":"2026-08-15T23:46:54.687560Z","submitted_at":"2025-05-06T13:41:31Z","title":"Joint Generalized Cosine Similarity: A Novel Method for N-Modal Semantic Alignment Based on Contrastive Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T23:55:36.084315Z"},"links":{"cited_paper":"/paper/1707.05612","citing_paper":"/paper/2505.03532"},"observation_digest":"sha256:8eaf5b7a58d7c9d32c295ab7d9f36aca85fb018bcfee6c884e7fa25f65bf7bf2","observation_id":"dee8e2ef-d54c-464f-999c-e23516a90bc1","resolution":{"observed_at":"2026-08-15T23:55:36.084315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:55:36.088328Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.03532","last_updated":"2025-05-06T13:41:31Z","snapshot_observed_at":"2026-08-15T23:46:54.687560Z","submitted_at":"2025-05-06T13:41:31Z","title":"Joint Generalized Cosine Similarity: A Novel Method for N-Modal Semantic Alignment Based on Contrastive Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T23:55:36.088328Z"},"links":{"citing_paper":"/paper/2505.03532"},"observation_digest":"sha256:be67db82b84d7b17a557ec92d935fc85d3d5254e22fab09a55909129b7218372","observation_id":"cd15a8e2-13f2-4142-aabf-ec3a5d1aeed7","resolution":{"observed_at":"2026-08-15T23:55:36.088328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-08-16T07:24:08.156932Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-15T23:55:36.092557Z","title":"Eva-clip: Improved training techniques for clip at scale,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.03532","last_updated":"2025-05-06T13:41:31Z","snapshot_observed_at":"2026-08-15T23:46:54.687560Z","submitted_at":"2025-05-06T13:41:31Z","title":"Joint Generalized Cosine Similarity: A Novel Method for N-Modal Semantic Alignment Based on Contrastive Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T23:55:36.092557Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2505.03532"},"observation_digest":"sha256:37482ba022c47ac4ebb872858da2759425b837c083e09a2197d9c8088809a9eb","observation_id":"9fea8b21-ec6a-4bf3-82d0-d9c93c73a826","resolution":{"observed_at":"2026-08-15T23:55:36.092557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:55:36.447854Z","title":"Long-clip: Unlocking the long-text capability of clip,","venue":null,"work_id":"dde3cbc8-d3da-4bf6-86cb-d2b95a273544","year":2024},"citing_paper":{"arxiv_id":"2505.03532","last_updated":"2025-05-06T13:41:31Z","snapshot_observed_at":"2026-08-15T23:46:54.687560Z","submitted_at":"2025-05-06T13:41:31Z","title":"Joint Generalized Cosine Similarity: A Novel Method for N-Modal Semantic Alignment Based on Contrastive Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T23:55:36.097339Z"},"links":{"citing_paper":"/paper/2505.03532"},"observation_digest":"sha256:3cec86f6c8befef9e4b5eb23b269dc822f4f2766307964f2f149b09b54f95656","observation_id":"901a4998-b132-4eb7-883a-6969306f333c","resolution":{"observed_at":"2026-08-15T23:55:36.451399Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:55:36.101520Z","title":"Oscar: Object-semantics aligned pre-training for vision-language tasks,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.03532","last_updated":"2025-05-06T13:41:31Z","snapshot_observed_at":"2026-08-15T23:46:54.687560Z","submitted_at":"2025-05-06T13:41:31Z","title":"Joint Generalized Cosine Similarity: A Novel Method for N-Modal Semantic Alignment Based on Contrastive Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T23:55:36.101520Z"},"links":{"citing_paper":"/paper/2505.03532"},"observation_digest":"sha256:24522ce8d5d205861c6a64cfab44bd7d636c6f2c4f41919780891af3065ba925","observation_id":"5e9672a0-0374-48cb-9090-2fcc25f007b9","resolution":{"observed_at":"2026-08-15T23:55:36.101520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:55:36.105031Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.03532","last_updated":"2025-05-06T13:41:31Z","snapshot_observed_at":"2026-08-15T23:46:54.687560Z","submitted_at":"2025-05-06T13:41:31Z","title":"Joint Generalized Cosine Similarity: A Novel Method for N-Modal Semantic Alignment Based on Contrastive Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T23:55:36.105031Z"},"links":{"citing_paper":"/paper/2505.03532"},"observation_digest":"sha256:8893c5a9102d3215ede077743426d6b703b67010e8988c20cc8e134d5c8bf536","observation_id":"e80dfd1e-b755-4f0f-9391-968f5aefb1e4","resolution":{"observed_at":"2026-08-15T23:55:36.105031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:55:36.108657Z","title":"Vilbert: Pretraining task-agnostic visiolinguistic representations for vision-and-language tasks,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.03532","last_updated":"2025-05-06T13:41:31Z","snapshot_observed_at":"2026-08-15T23:46:54.687560Z","submitted_at":"2025-05-06T13:41:31Z","title":"Joint Generalized Cosine Similarity: A Novel Method for N-Modal Semantic Alignment Based on Contrastive Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T23:55:36.108657Z"},"links":{"citing_paper":"/paper/2505.03532"},"observation_digest":"sha256:7060048b4e68c6b65b6ad9715f51e140bf4d36b75d3dabc67a867595cef12198","observation_id":"b9bf4f69-3e32-41f9-87c4-9775749634de","resolution":{"observed_at":"2026-08-15T23:55:36.108657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:55:36.112140Z","title":"Vilt: Vision-and-language transformer without convolution or region supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.03532","last_updated":"2025-05-06T13:41:31Z","snapshot_observed_at":"2026-08-15T23:46:54.687560Z","submitted_at":"2025-05-06T13:41:31Z","title":"Joint Generalized Cosine Similarity: A Novel Method for N-Modal Semantic Alignment Based on Contrastive Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T23:55:36.112140Z"},"links":{"citing_paper":"/paper/2505.03532"},"observation_digest":"sha256:bc8fa970448e63a78e8ddcaa6792c7c650b47c01e0d284c08d8d879e30105cde","observation_id":"2cd4083b-1755-4dea-8837-bee177d955f8","resolution":{"observed_at":"2026-08-15T23:55:36.112140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.14556","last_updated":"2022-10-26T08:24:15Z","snapshot_observed_at":"2026-08-16T16:21:03.247178Z","submitted_at":"2022-10-26T08:24:15Z","title":"Multimodal Contrastive Learning via Uni-Modal Coding and Cross-Modal Prediction for Multimodal Sentiment Analysis","version":1},"cited_work":{"arxiv_id":"2210.14556","doi":null,"metadata_source":"pith","pith_arxiv_id":"2210.14556","snapshot_observed_at":"2026-08-15T23:55:36.250528Z","title":"Multimodal Contrastive Learning via Uni-Modal Coding and Cross-Modal Prediction for Multimodal Sentiment Analysis","venue":"cs.CL","work_id":"2a8ce1c0-b478-42e8-8c56-78e9370a7391","year":2022},"citing_paper":{"arxiv_id":"2505.03532","last_updated":"2025-05-06T13:41:31Z","snapshot_observed_at":"2026-08-15T23:46:54.687560Z","submitted_at":"2025-05-06T13:41:31Z","title":"Joint Generalized Cosine Similarity: A Novel Method for N-Modal Semantic Alignment Based on Contrastive Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T23:55:36.115711Z"},"links":{"cited_paper":"/paper/2210.14556","citing_paper":"/paper/2505.03532"},"observation_digest":"sha256:dfec785cc016ebd28d8f2102f0de61c6f5c2e933c15df5d3de40288e905e8de3","observation_id":"610dcb60-3981-4fde-bab7-1b05757e23af","resolution":{"observed_at":"2026-08-15T23:55:36.254812Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:55:36.119217Z","title":"Triplet-based deep hashing network for cross-modal retrieval,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.03532","last_updated":"2025-05-06T13:41:31Z","snapshot_observed_at":"2026-08-15T23:46:54.687560Z","submitted_at":"2025-05-06T13:41:31Z","title":"Joint Generalized Cosine Similarity: A Novel Method for N-Modal Semantic Alignment Based on Contrastive Learning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T23:55:36.119217Z"},"links":{"citing_paper":"/paper/2505.03532"},"observation_digest":"sha256:0a87f2ebf17a38ee3162b31afe1a46e786258be8760686626969507d37041961","observation_id":"909ffdcf-b3f5-4a6f-979f-6d94dceebb5b","resolution":{"observed_at":"2026-08-15T23:55:36.119217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-08-14T18:53:38.574749Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-08-15T23:55:36.122734Z","title":"Representation learning with contrastive predictive coding,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.03532","last_updated":"2025-05-06T13:41:31Z","snapshot_observed_at":"2026-08-15T23:46:54.687560Z","submitted_at":"2025-05-06T13:41:31Z","title":"Joint Generalized Cosine Similarity: A Novel Method for N-Modal Semantic Alignment Based on Contrastive Learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T23:55:36.122734Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2505.03532"},"observation_digest":"sha256:47136cf640fd1f3e97c5834c2b7da165cd5320b5349f671c85c055f2402a96a8","observation_id":"5c182d9f-6b53-4afe-bd1d-58b6a1771d38","resolution":{"observed_at":"2026-08-15T23:55:36.122734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:55:36.126704Z","title":"Momentum contrast for unsupervised visual representation learning,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.03532","last_updated":"2025-05-06T13:41:31Z","snapshot_observed_at":"2026-08-15T23:46:54.687560Z","submitted_at":"2025-05-06T13:41:31Z","title":"Joint Generalized Cosine Similarity: A Novel Method for N-Modal Semantic Alignment Based on Contrastive Learning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T23:55:36.126704Z"},"links":{"citing_paper":"/paper/2505.03532"},"observation_digest":"sha256:6447673071a11901b0d7adc114bac18750762eda587a5a5ba2889c3f79c2c7fb","observation_id":"db29472c-a514-4904-b37b-c95eaf9e8553","resolution":{"observed_at":"2026-08-15T23:55:36.126704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:55:36.130177Z","title":"A simple framework for contrastive learning of visual representations,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.03532","last_updated":"2025-05-06T13:41:31Z","snapshot_observed_at":"2026-08-15T23:46:54.687560Z","submitted_at":"2025-05-06T13:41:31Z","title":"Joint Generalized Cosine Similarity: A Novel Method for N-Modal Semantic Alignment Based on Contrastive Learning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T23:55:36.130177Z"},"links":{"citing_paper":"/paper/2505.03532"},"observation_digest":"sha256:f974368199a1853cd191c96bc9cec09e9924580e0e2b2bec58b99f5bcac9d515","observation_id":"e065964a-8911-4cf1-a49f-0d4ecbebf13c","resolution":{"observed_at":"2026-08-15T23:55:36.130177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:55:36.390619Z","title":"Semantic alignment network for multi-modal emotion recognition,","venue":null,"work_id":"fcae45cd-e8b9-4b57-83b5-c7aa0f087cd9","year":2023},"citing_paper":{"arxiv_id":"2505.03532","last_updated":"2025-05-06T13:41:31Z","snapshot_observed_at":"2026-08-15T23:46:54.687560Z","submitted_at":"2025-05-06T13:41:31Z","title":"Joint Generalized Cosine Similarity: A Novel Method for N-Modal Semantic Alignment Based on Contrastive Learning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T23:55:36.133453Z"},"links":{"citing_paper":"/paper/2505.03532"},"observation_digest":"sha256:7c7d0ddeef0b6e34d9ad8d0a66a3fa15d3d85a08981126aa0eea3feeb1b6d394","observation_id":"ce602085-9f28-4166-9104-5a890999973c","resolution":{"observed_at":"2026-08-15T23:55:36.394462Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.02162","last_updated":"2025-03-11T00:50:53Z","snapshot_observed_at":"2026-08-16T12:53:23.727623Z","submitted_at":"2025-03-04T00:48:09Z","title":"X2CT-CLIP: Enable Multi-Abnormality Detection in Computed Tomography from Chest Radiography via Tri-Modal Contrastive Learning","version":2},"cited_work":{"arxiv_id":"2503.02162","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.02162","snapshot_observed_at":"2026-08-15T23:55:36.225015Z","title":"X2CT-CLIP: Enable Multi-Abnormality Detection in Computed Tomography from Chest Radiography via Tri-Modal Contrastive Learning","venue":"cs.CV","work_id":"955cf0f6-d4d5-42c6-afa0-5f2da4a2f744","year":2025},"citing_paper":{"arxiv_id":"2505.03532","last_updated":"2025-05-06T13:41:31Z","snapshot_observed_at":"2026-08-15T23:46:54.687560Z","submitted_at":"2025-05-06T13:41:31Z","title":"Joint Generalized Cosine Similarity: A Novel Method for N-Modal Semantic Alignment Based on Contrastive Learning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T23:55:36.136656Z"},"links":{"cited_paper":"/paper/2503.02162","citing_paper":"/paper/2505.03532"},"observation_digest":"sha256:2beeb47aed5948768872b9b8bcfebe2e6b9e328e7196a2adf07a514208cde24c","observation_id":"17c6e5a0-2e34-434c-a601-366e8d5a9101","resolution":{"observed_at":"2026-08-15T23:55:36.229441Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:55:36.379774Z","title":"Hybrid contrastive learning of tri-modal representation for multimodal sentiment analysis,","venue":null,"work_id":"acc59d15-f067-490d-9527-e297b450246a","year":2022},"citing_paper":{"arxiv_id":"2505.03532","last_updated":"2025-05-06T13:41:31Z","snapshot_observed_at":"2026-08-15T23:46:54.687560Z","submitted_at":"2025-05-06T13:41:31Z","title":"Joint Generalized Cosine Similarity: A Novel Method for N-Modal Semantic Alignment Based on Contrastive Learning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T23:55:36.140631Z"},"links":{"citing_paper":"/paper/2505.03532"},"observation_digest":"sha256:10c24a3f7478f1bb0e1b1bfb58d7b668cfb2c6f2e61d92c4d92b49cedbf770c5","observation_id":"5a554f16-9df2-4cc5-933c-bfb189655317","resolution":{"observed_at":"2026-08-15T23:55:36.383475Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:55:36.368209Z","title":"Tri-clt: Learning tri-modal representations with contrastive learning and transformer for multimodal sentiment recognition,","venue":null,"work_id":"3978c510-093e-4b3c-b15e-87e191c6ae66","year":2024},"citing_paper":{"arxiv_id":"2505.03532","last_updated":"2025-05-06T13:41:31Z","snapshot_observed_at":"2026-08-15T23:46:54.687560Z","submitted_at":"2025-05-06T13:41:31Z","title":"Joint Generalized Cosine Similarity: A Novel Method for N-Modal Semantic Alignment Based on Contrastive Learning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T23:55:36.144267Z"},"links":{"citing_paper":"/paper/2505.03532"},"observation_digest":"sha256:56daae3e81905829b14dd0d975dd6d167164ad125b0b00c78e1419ac48e3a695","observation_id":"3f811589-2d18-403e-8eb0-6b8f4293c78b","resolution":{"observed_at":"2026-08-15T23:55:36.371975Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:55:36.147885Z","title":"Tricolo: Trimodal contrastive loss for text to shape retrieval,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.03532","last_updated":"2025-05-06T13:41:31Z","snapshot_observed_at":"2026-08-15T23:46:54.687560Z","submitted_at":"2025-05-06T13:41:31Z","title":"Joint Generalized Cosine Similarity: A Novel Method for N-Modal Semantic Alignment Based on Contrastive Learning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T23:55:36.147885Z"},"links":{"citing_paper":"/paper/2505.03532"},"observation_digest":"sha256:8ff5089711ab88dbee7ad27a7b6ab7bde979780558756823b2095e93dd76fbee","observation_id":"4adb5ec0-242d-4a3e-ac49-6a58e46eddd5","resolution":{"observed_at":"2026-08-15T23:55:36.147885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:55:36.350585Z","title":"Con- trastive learning of medical visual representations from paired images and text,","venue":null,"work_id":"2985d089-c43c-458c-a97c-bba5afb86296","year":2022},"citing_paper":{"arxiv_id":"2505.03532","last_updated":"2025-05-06T13:41:31Z","snapshot_observed_at":"2026-08-15T23:46:54.687560Z","submitted_at":"2025-05-06T13:41:31Z","title":"Joint Generalized Cosine Similarity: A Novel Method for N-Modal Semantic Alignment Based on Contrastive Learning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T23:55:36.151259Z"},"links":{"citing_paper":"/paper/2505.03532"},"observation_digest":"sha256:bc42e1c5e34d748621bfd132ca1a4fb263f372244a7598fd56adfc30c8c8fa8d","observation_id":"b0e7563e-585c-48a2-96fc-43dbc5b165cb","resolution":{"observed_at":"2026-08-15T23:55:36.354735Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.13279","last_updated":"2022-05-26T11:34:08Z","snapshot_observed_at":"2026-08-16T16:57:30.317745Z","submitted_at":"2022-05-26T11:34:08Z","title":"Triangular Contrastive Learning on Molecular Graphs","version":1},"cited_work":{"arxiv_id":"2205.13279","doi":null,"metadata_source":"pith","pith_arxiv_id":"2205.13279","snapshot_observed_at":"2026-08-15T23:55:36.207586Z","title":"Triangular Contrastive Learning on Molecular Graphs","venue":"cs.LG","work_id":"2e906ca7-aaa5-4fa9-8b3b-4ce88af2d3ee","year":2022},"citing_paper":{"arxiv_id":"2505.03532","last_updated":"2025-05-06T13:41:31Z","snapshot_observed_at":"2026-08-15T23:46:54.687560Z","submitted_at":"2025-05-06T13:41:31Z","title":"Joint Generalized Cosine Similarity: A Novel Method for N-Modal Semantic Alignment Based on Contrastive Learning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T23:55:36.155164Z"},"links":{"cited_paper":"/paper/2205.13279","citing_paper":"/paper/2505.03532"},"observation_digest":"sha256:54df3ecf3e3bd34da613530e770e4d09bcfd700ef2c60514b974d3f4bb16ff23","observation_id":"07abb902-4f2e-4c84-86ee-3faa6b2846b9","resolution":{"observed_at":"2026-08-15T23:55:36.213401Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:55:36.339558Z","title":"Seven- point checklist and skin lesion classification using multitask multimodal neural nets,","venue":null,"work_id":"29a4b449-f56c-40aa-895c-6c29145a2454","year":2018},"citing_paper":{"arxiv_id":"2505.03532","last_updated":"2025-05-06T13:41:31Z","snapshot_observed_at":"2026-08-15T23:46:54.687560Z","submitted_at":"2025-05-06T13:41:31Z","title":"Joint Generalized Cosine Similarity: A Novel Method for N-Modal Semantic Alignment Based on Contrastive Learning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T23:55:36.158883Z"},"links":{"citing_paper":"/paper/2505.03532"},"observation_digest":"sha256:9e0bd21103d2493978da7672357f4fed046894fb3abd1fb53de46562e08ddfde","observation_id":"99309edd-4bda-4b15-902f-389e59377faf","resolution":{"observed_at":"2026-08-15T23:55:36.343361Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-08-14T18:51:16.666127Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-15T23:55:36.162324Z","title":"Adam: A method for stochastic optimization,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.03532","last_updated":"2025-05-06T13:41:31Z","snapshot_observed_at":"2026-08-15T23:46:54.687560Z","submitted_at":"2025-05-06T13:41:31Z","title":"Joint Generalized Cosine Similarity: A Novel Method for N-Modal Semantic Alignment Based on Contrastive Learning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T23:55:36.162324Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2505.03532"},"observation_digest":"sha256:3bb4764a6799efd478069925b36dad58dfaaec79d9133b44ce21b5a912f67349","observation_id":"4b765122-8914-4382-a16f-e8a15d054808","resolution":{"observed_at":"2026-08-15T23:55:36.162324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:55:36.165878Z","title":"Focal loss for dense object detection,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.03532","last_updated":"2025-05-06T13:41:31Z","snapshot_observed_at":"2026-08-15T23:46:54.687560Z","submitted_at":"2025-05-06T13:41:31Z","title":"Joint Generalized Cosine Similarity: A Novel Method for N-Modal Semantic Alignment Based on Contrastive Learning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T23:55:36.165878Z"},"links":{"citing_paper":"/paper/2505.03532"},"observation_digest":"sha256:fcef137c4c32a821b58c0671dfba853da0dbd9a36028d2db2ed9bf20694445de","observation_id":"8daefaee-402c-4f33-90f4-f2bead281722","resolution":{"observed_at":"2026-08-15T23:55:36.165878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.03532","last_updated":"2025-05-06T13:41:31Z","latest_version":1,"primary_category":"stat.AP","snapshot_observed_at":"2026-08-15T23:46:54.687560Z","submitted_at":"2025-05-06T13:41:31Z","title":"Joint Generalized Cosine Similarity: A Novel Method for N-Modal Semantic Alignment Based on Contrastive Learning"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":21,"verified_exact":3,"verified_fuzzy":17},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 0 inbound Pith citation observations for arXiv:2505.03532."}