{"as_of":"2026-08-12T20:20:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:830696b7799a6ded9a31eb52ceeafd77ffc2d7cad01cf81248165eb1cee49983","coverage":[{"denominator":44,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":44,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T05:01:42.107189Z","state":"measured"},{"denominator":44,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":44,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.00833/citation-record","integrity":"/paper/2412.00833/integrity","json":"/paper/2412.00833/citation-record.json","paper":"/paper/2412.00833"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:01:42.615842Z","title":"Deep canonical correlation analysis","venue":null,"work_id":"9e10b0ec-b826-4837-85b3-a77640534afa","year":2013},"citing_paper":{"arxiv_id":"2412.00833","last_updated":"2024-12-01T14:47:41Z","snapshot_observed_at":"2026-08-12T06:43:15.732392Z","submitted_at":"2024-12-01T14:47:41Z","title":"AlignMamba: Enhancing Multimodal Mamba with Local and Global Cross-modal Alignment","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T05:01:41.949686Z"},"links":{"citing_paper":"/paper/2412.00833"},"observation_digest":"sha256:3b89eb9d4eb339a92237f4e6fea8d393d834dff226cbc2b8cfb471c3ff2a57c8","observation_id":"7d4c8d41-7d60-4e73-ad17-52a33022ce7a","resolution":{"observed_at":"2026-08-12T05:01:42.620005Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09146","last_updated":"2024-04-14T05:28:46Z","snapshot_observed_at":"2026-07-06T17:59:50.796592Z","submitted_at":"2024-04-14T05:28:46Z","title":"Fusion-Mamba for Cross-modality Object Detection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.09146","snapshot_observed_at":"2026-08-12T05:01:41.953655Z","title":"Fusion-mamba for cross-modality object detection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.00833","last_updated":"2024-12-01T14:47:41Z","snapshot_observed_at":"2026-08-12T06:43:15.732392Z","submitted_at":"2024-12-01T14:47:41Z","title":"AlignMamba: Enhancing Multimodal Mamba with Local and Global Cross-modal Alignment","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T05:01:41.953655Z"},"links":{"cited_paper":"/paper/2404.09146","citing_paper":"/paper/2412.00833"},"observation_digest":"sha256:703575a7569a8b6655b9826482f6fe6273cb731b3c5f23ecfa72130fa33d5960","observation_id":"c7f7d7b1-bf6e-4b5f-9ada-9927b5f49c2c","resolution":{"observed_at":"2026-08-12T05:01:41.953655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00752","last_updated":"2024-05-31T17:55:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-01T18:01:34Z","title":"Mamba: Linear-Time Sequence Modeling with Selective State Spaces","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.00752","snapshot_observed_at":"2026-08-12T05:01:41.957393Z","title":"Mamba: Linear-time sequence modeling with selective state spaces","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.00833","last_updated":"2024-12-01T14:47:41Z","snapshot_observed_at":"2026-08-12T06:43:15.732392Z","submitted_at":"2024-12-01T14:47:41Z","title":"AlignMamba: Enhancing Multimodal Mamba with Local and Global Cross-modal Alignment","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T05:01:41.957393Z"},"links":{"cited_paper":"/paper/2312.00752","citing_paper":"/paper/2412.00833"},"observation_digest":"sha256:81fb9bb1a8840063a9ee104d0306cd2cc3c5f35e6827bc5178e4d5489576920e","observation_id":"f5f1e30c-302c-4ee9-bc40-be641096c485","resolution":{"observed_at":"2026-08-12T05:01:41.957393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:01:42.604426Z","title":"Combining recurrent, convolutional, and continuous-time models with linear state space layers","venue":null,"work_id":"9adb45d7-5dd7-4897-8ae8-c2e24b19112f","year":2021},"citing_paper":{"arxiv_id":"2412.00833","last_updated":"2024-12-01T14:47:41Z","snapshot_observed_at":"2026-08-12T06:43:15.732392Z","submitted_at":"2024-12-01T14:47:41Z","title":"AlignMamba: Enhancing Multimodal Mamba with Local and Global Cross-modal Alignment","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T05:01:41.961034Z"},"links":{"citing_paper":"/paper/2412.00833"},"observation_digest":"sha256:0b119484477e89b6c6887e8e849b9ba76eb061469f8d36fee330861512a2271e","observation_id":"6cfd4e9d-3cd8-4111-b126-ae96613244b8","resolution":{"observed_at":"2026-08-12T05:01:42.608486Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:01:42.593390Z","title":"On the parameterization and initialization of diagonal state space models","venue":null,"work_id":"dc0cfcb4-3fd6-4867-9679-9a4750657b2f","year":2022},"citing_paper":{"arxiv_id":"2412.00833","last_updated":"2024-12-01T14:47:41Z","snapshot_observed_at":"2026-08-12T06:43:15.732392Z","submitted_at":"2024-12-01T14:47:41Z","title":"AlignMamba: Enhancing Multimodal Mamba with Local and Global Cross-modal Alignment","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T05:01:41.964516Z"},"links":{"citing_paper":"/paper/2412.00833"},"observation_digest":"sha256:deb4db27d72919bbea096651189e778ef5c59200045f858a4ac399193970c61d","observation_id":"921e6ac1-74c2-4917-b30c-e99069d7f5ab","resolution":{"observed_at":"2026-08-12T05:01:42.597500Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.00412","last_updated":"2021-09-16T08:32:03Z","snapshot_observed_at":"2026-08-09T19:44:37.485389Z","submitted_at":"2021-09-01T14:45:16Z","title":"Improving Multimodal Fusion with Hierarchical Mutual Information Maximization for Multimodal Sentiment Analysis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.00412","snapshot_observed_at":"2026-08-12T05:01:41.968518Z","title":"Improving mul- timodal fusion with hierarchical mutual information maxi- mization for multimodal sentiment analysis","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.00833","last_updated":"2024-12-01T14:47:41Z","snapshot_observed_at":"2026-08-12T06:43:15.732392Z","submitted_at":"2024-12-01T14:47:41Z","title":"AlignMamba: Enhancing Multimodal Mamba with Local and Global Cross-modal Alignment","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T05:01:41.968518Z"},"links":{"cited_paper":"/paper/2109.00412","citing_paper":"/paper/2412.00833"},"observation_digest":"sha256:ce56a30df212c903ab0b0e7918d82810c8b70b26574f51ee80fb33b8c6d9665c","observation_id":"7207e367-8a94-49b3-9304-b8935b3e3654","resolution":{"observed_at":"2026-08-12T05:01:41.968518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:01:42.581773Z","title":"Misa: Modality-invariant and-specific representations for multimodal sentiment analysis","venue":null,"work_id":"331328a2-6f16-41a9-bf1b-4953fbb84aa0","year":2020},"citing_paper":{"arxiv_id":"2412.00833","last_updated":"2024-12-01T14:47:41Z","snapshot_observed_at":"2026-08-12T06:43:15.732392Z","submitted_at":"2024-12-01T14:47:41Z","title":"AlignMamba: Enhancing Multimodal Mamba with Local and Global Cross-modal Alignment","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T05:01:41.973036Z"},"links":{"citing_paper":"/paper/2412.00833"},"observation_digest":"sha256:db8f397a843d1fb36994f087885d16b31831f377da1714ccb753d589b484b6d2","observation_id":"b96632cf-0d47-4f91-8e05-b88899998e9f","resolution":{"observed_at":"2026-08-12T05:01:42.585848Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12192","last_updated":"2024-03-09T03:16:25Z","snapshot_observed_at":"2026-08-10T09:07:40.009358Z","submitted_at":"2024-02-19T14:54:54Z","title":"Pan-Mamba: Effective pan-sharpening with State Space Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12192","snapshot_observed_at":"2026-08-12T05:01:41.976307Z","title":"Pan-mamba: Effective pan-sharpening with state space model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.00833","last_updated":"2024-12-01T14:47:41Z","snapshot_observed_at":"2026-08-12T06:43:15.732392Z","submitted_at":"2024-12-01T14:47:41Z","title":"AlignMamba: Enhancing Multimodal Mamba with Local and Global Cross-modal Alignment","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T05:01:41.976307Z"},"links":{"cited_paper":"/paper/2402.12192","citing_paper":"/paper/2412.00833"},"observation_digest":"sha256:1cf352f44baa76cc958af897ff3f3cc946fd399aeca166cc3eaa1750dd9d9376","observation_id":"cde4110f-c286-41d0-bd8b-f3d86c349325","resolution":{"observed_at":"2026-08-12T05:01:41.976307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:01:42.569797Z","title":"Self-supervised uni- modal label generation strategy using recalibrated modality representations for multimodal sentiment analysis","venue":null,"work_id":"669d471f-fd39-4d17-851a-21eba2e31488","year":2023},"citing_paper":{"arxiv_id":"2412.00833","last_updated":"2024-12-01T14:47:41Z","snapshot_observed_at":"2026-08-12T06:43:15.732392Z","submitted_at":"2024-12-01T14:47:41Z","title":"AlignMamba: Enhancing Multimodal Mamba with Local and Global Cross-modal Alignment","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T05:01:41.980532Z"},"links":{"citing_paper":"/paper/2412.00833"},"observation_digest":"sha256:81260b557f364d16c92fef79994418920621583ad125c0f2cab001c334c4480a","observation_id":"2d99e148-80f8-4dc8-9ca4-24dc22df71dd","resolution":{"observed_at":"2026-08-12T05:01:42.573845Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:01:42.558434Z","title":"Aobert: All- modalities-in-one bert for multimodal sentiment analysis.In- formation Fusion, 92:37–45, 2023","venue":null,"work_id":"31d9a568-43f3-4527-a639-93c2a85d43db","year":2023},"citing_paper":{"arxiv_id":"2412.00833","last_updated":"2024-12-01T14:47:41Z","snapshot_observed_at":"2026-08-12T06:43:15.732392Z","submitted_at":"2024-12-01T14:47:41Z","title":"AlignMamba: Enhancing Multimodal Mamba with Local and Global Cross-modal Alignment","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T05:01:41.983692Z"},"links":{"citing_paper":"/paper/2412.00833"},"observation_digest":"sha256:b98a7bb740eac46c4fbee718341f5a126a42e1c52cce3f920f49a985c44b94dd","observation_id":"c9045d50-770d-4570-8ffe-7f0704aac787","resolution":{"observed_at":"2026-08-12T05:01:42.562638Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:01:42.546841Z","title":"Vilt: Vision- and-language transformer without convolution or region su- pervision","venue":null,"work_id":"22e93134-59bd-4ca8-81c5-46b09e07316d","year":2021},"citing_paper":{"arxiv_id":"2412.00833","last_updated":"2024-12-01T14:47:41Z","snapshot_observed_at":"2026-08-12T06:43:15.732392Z","submitted_at":"2024-12-01T14:47:41Z","title":"AlignMamba: Enhancing Multimodal Mamba with Local and Global Cross-modal Alignment","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T05:01:41.987352Z"},"links":{"citing_paper":"/paper/2412.00833"},"observation_digest":"sha256:f144cdeacb2e8fd50f31b9915320d77b4e17b6bb57b173955d3050e086217aec","observation_id":"d44c8e9a-2aeb-4416-83ef-1c1e3df1addd","resolution":{"observed_at":"2026-08-12T05:01:42.550489Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:01:42.535557Z","title":"From word embeddings to document distances","venue":null,"work_id":"1f33b876-d84f-46d5-be26-93c192c0ea6e","year":null},"citing_paper":{"arxiv_id":"2412.00833","last_updated":"2024-12-01T14:47:41Z","snapshot_observed_at":"2026-08-12T06:43:15.732392Z","submitted_at":"2024-12-01T14:47:41Z","title":"AlignMamba: Enhancing Multimodal Mamba with Local and Global Cross-modal Alignment","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T05:01:41.991299Z"},"links":{"citing_paper":"/paper/2412.00833"},"observation_digest":"sha256:0f31d5d7be8e0c2dca988bca69e8fd017743ab7c0b5b8d0e5ff88e7c88e80967","observation_id":"6429730b-b8c4-4a87-8290-3c3f02c4b660","resolution":{"observed_at":"2026-08-12T05:01:42.539372Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:01:42.524499Z","title":"Cross-attentional audio-visual fusion for weakly- supervised action localization","venue":null,"work_id":"b389befd-e164-4c03-a2ae-4b4caba4dec5","year":2020},"citing_paper":{"arxiv_id":"2412.00833","last_updated":"2024-12-01T14:47:41Z","snapshot_observed_at":"2026-08-12T06:43:15.732392Z","submitted_at":"2024-12-01T14:47:41Z","title":"AlignMamba: Enhancing Multimodal Mamba with Local and Global Cross-modal Alignment","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T05:01:41.995081Z"},"links":{"citing_paper":"/paper/2412.00833"},"observation_digest":"sha256:dfb30e730deddc041a15cf851519cc4c70ee7e72d8ab2faf2583c82ec1f9fd93","observation_id":"7e26e232-9947-4fc7-9fb8-e77efa733eb0","resolution":{"observed_at":"2026-08-12T05:01:42.528319Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:01:41.998573Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.00833","last_updated":"2024-12-01T14:47:41Z","snapshot_observed_at":"2026-08-12T06:43:15.732392Z","submitted_at":"2024-12-01T14:47:41Z","title":"AlignMamba: Enhancing Multimodal Mamba with Local and Global Cross-modal Alignment","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T05:01:41.998573Z"},"links":{"citing_paper":"/paper/2412.00833"},"observation_digest":"sha256:411c166bd6ddf11bab2150cc3322d5e6a63b6fbb595df77e10e85558f735ee3b","observation_id":"087872ad-16a8-4613-844f-aad0ffed7bc2","resolution":{"observed_at":"2026-08-12T05:01:41.998573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.03557","last_updated":"2019-08-09T17:57:13Z","snapshot_observed_at":"2026-08-07T01:39:40.489262Z","submitted_at":"2019-08-09T17:57:13Z","title":"VisualBERT: A Simple and Performant Baseline for Vision and Language","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.03557","snapshot_observed_at":"2026-08-12T05:01:42.002568Z","title":"Visualbert: A simple and perfor- mant baseline for vision and language","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2412.00833","last_updated":"2024-12-01T14:47:41Z","snapshot_observed_at":"2026-08-12T06:43:15.732392Z","submitted_at":"2024-12-01T14:47:41Z","title":"AlignMamba: Enhancing Multimodal Mamba with Local and Global Cross-modal Alignment","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T05:01:42.002568Z"},"links":{"cited_paper":"/paper/1908.03557","citing_paper":"/paper/2412.00833"},"observation_digest":"sha256:2db32c8ceeee3dfba63df3c3ec98f8bbded891725d4e4dd3ea66e88310dafa98","observation_id":"52ef0e74-b9fb-4d26-aa6c-795695eed6b7","resolution":{"observed_at":"2026-08-12T05:01:42.002568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:01:42.506298Z","title":"Decoupled multi- modal distilling for emotion recognition","venue":null,"work_id":"4966e121-b1b0-4e8a-a4f9-07cf90f53a4a","year":2023},"citing_paper":{"arxiv_id":"2412.00833","last_updated":"2024-12-01T14:47:41Z","snapshot_observed_at":"2026-08-12T06:43:15.732392Z","submitted_at":"2024-12-01T14:47:41Z","title":"AlignMamba: Enhancing Multimodal Mamba with Local and Global Cross-modal Alignment","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T05:01:42.005747Z"},"links":{"citing_paper":"/paper/2412.00833"},"observation_digest":"sha256:93925b08feea56e75339662c0214408b219cb15059d070f3d4f69bfafccd14ab","observation_id":"e8812559-4b0a-4fb1-9cee-ff858f0e144a","resolution":{"observed_at":"2026-08-12T05:01:42.509905Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.08406","last_updated":"2024-04-12T11:33:26Z","snapshot_observed_at":"2026-08-09T18:56:21.464843Z","submitted_at":"2024-04-12T11:33:26Z","title":"MambaDFuse: A Mamba-based Dual-phase Model for Multi-modality Image Fusion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.08406","snapshot_observed_at":"2026-08-12T05:01:42.009245Z","title":"Mambadfuse: A mamba-based dual-phase model for multi-modality image fusion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.00833","last_updated":"2024-12-01T14:47:41Z","snapshot_observed_at":"2026-08-12T06:43:15.732392Z","submitted_at":"2024-12-01T14:47:41Z","title":"AlignMamba: Enhancing Multimodal Mamba with Local and Global Cross-modal Alignment","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T05:01:42.009245Z"},"links":{"cited_paper":"/paper/2404.08406","citing_paper":"/paper/2412.00833"},"observation_digest":"sha256:54e09079fb40e973f33626549044e1c8a97d3f70e1cdc7495d42f7f8fbf9dc9e","observation_id":"fa001f0e-2dc7-4b99-8717-6faf7af4597e","resolution":{"observed_at":"2026-08-12T05:01:42.009245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:01:42.495510Z","title":"Gcnet: Graph completion network for incomplete mul- timodal learning in conversation","venue":null,"work_id":"0b300e7a-914f-4e1e-82dd-925c6b012a73","year":null},"citing_paper":{"arxiv_id":"2412.00833","last_updated":"2024-12-01T14:47:41Z","snapshot_observed_at":"2026-08-12T06:43:15.732392Z","submitted_at":"2024-12-01T14:47:41Z","title":"AlignMamba: Enhancing Multimodal Mamba with Local and Global Cross-modal Alignment","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T05:01:42.013056Z"},"links":{"citing_paper":"/paper/2412.00833"},"observation_digest":"sha256:ed1943c401a144e30f21dee6b556343be114aa10ca72590e8339f2731756b95a","observation_id":"16ec7d83-81e9-4383-956c-b4c2abb0717d","resolution":{"observed_at":"2026-08-12T05:01:42.499164Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02228","last_updated":"2024-07-14T07:50:04Z","snapshot_observed_at":"2026-08-01T19:25:15.741845Z","submitted_at":"2024-07-02T12:52:18Z","title":"MTMamba: Enhancing Multi-Task Dense Scene Understanding by Mamba-Based Decoders","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.02228","snapshot_observed_at":"2026-08-12T05:01:42.016592Z","title":"Mtmamba: Enhancing multi- task dense scene understanding by mamba-based decoders","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.00833","last_updated":"2024-12-01T14:47:41Z","snapshot_observed_at":"2026-08-12T06:43:15.732392Z","submitted_at":"2024-12-01T14:47:41Z","title":"AlignMamba: Enhancing Multimodal Mamba with Local and Global Cross-modal Alignment","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T05:01:42.016592Z"},"links":{"cited_paper":"/paper/2407.02228","citing_paper":"/paper/2412.00833"},"observation_digest":"sha256:e3de7d5333151ac5ae5ea0919e3156939a5b16f9188b8352dc803d8f5249fde0","observation_id":"a49bf077-7768-4198-b15b-6bb33459a8e3","resolution":{"observed_at":"2026-08-12T05:01:42.016592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:01:42.483728Z","title":"Multi-task momentum distil- lation for multimodal sentiment analysis","venue":null,"work_id":"28d98853-8dd4-4e6e-91c6-561b71311184","year":2023},"citing_paper":{"arxiv_id":"2412.00833","last_updated":"2024-12-01T14:47:41Z","snapshot_observed_at":"2026-08-12T06:43:15.732392Z","submitted_at":"2024-12-01T14:47:41Z","title":"AlignMamba: Enhancing Multimodal Mamba with Local and Global Cross-modal Alignment","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T05:01:42.019835Z"},"links":{"citing_paper":"/paper/2412.00833"},"observation_digest":"sha256:7b03f80b74b57331277a4d58809f2243163a8012acac48bc30fe376a10ec450b","observation_id":"9c9ff477-4336-4ecf-b69c-b974801c8a28","resolution":{"observed_at":"2026-08-12T05:01:42.487802Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08485","last_updated":"2023-12-11T17:46:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-17T17:59:25Z","title":"Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.08485","snapshot_observed_at":"2026-08-12T05:01:42.023043Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.00833","last_updated":"2024-12-01T14:47:41Z","snapshot_observed_at":"2026-08-12T06:43:15.732392Z","submitted_at":"2024-12-01T14:47:41Z","title":"AlignMamba: Enhancing Multimodal Mamba with Local and Global Cross-modal Alignment","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T05:01:42.023043Z"},"links":{"cited_paper":"/paper/2304.08485","citing_paper":"/paper/2412.00833"},"observation_digest":"sha256:c3921fd80671e4bff80e8f877b9564d1d3dbde54b1f16da322dc3ed2e91e8313","observation_id":"08f2b486-d192-408f-a0f9-063cb99f5746","resolution":{"observed_at":"2026-08-12T05:01:42.023043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04339","last_updated":"2024-12-14T18:41:03Z","snapshot_observed_at":"2026-08-12T01:35:43.336612Z","submitted_at":"2024-06-06T17:59:47Z","title":"RoboMamba: Efficient Vision-Language-Action Model for Robotic Reasoning and Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04339","snapshot_observed_at":"2026-08-12T05:01:42.026704Z","title":"Robomamba: Mul- timodal state space model for efficient robot reasoning and manipulation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.00833","last_updated":"2024-12-01T14:47:41Z","snapshot_observed_at":"2026-08-12T06:43:15.732392Z","submitted_at":"2024-12-01T14:47:41Z","title":"AlignMamba: Enhancing Multimodal Mamba with Local and Global Cross-modal Alignment","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T05:01:42.026704Z"},"links":{"cited_paper":"/paper/2406.04339","citing_paper":"/paper/2412.00833"},"observation_digest":"sha256:3ae0a07640a969308b1d271261c5ce3f1b7f297ef358508c5dda26dec496deef","observation_id":"35223bdc-c217-413e-912a-726110aaba46","resolution":{"observed_at":"2026-08-12T05:01:42.026704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:01:42.468090Z","title":"Vilbert: Pretraining task-agnostic visiolinguistic representations for vision-and-language tasks","venue":null,"work_id":"cf637a39-357c-41bd-be2c-6e1a95834f14","year":2019},"citing_paper":{"arxiv_id":"2412.00833","last_updated":"2024-12-01T14:47:41Z","snapshot_observed_at":"2026-08-12T06:43:15.732392Z","submitted_at":"2024-12-01T14:47:41Z","title":"AlignMamba: Enhancing Multimodal Mamba with Local and Global Cross-modal Alignment","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T05:01:42.030933Z"},"links":{"citing_paper":"/paper/2412.00833"},"observation_digest":"sha256:e2fb1bc91a2dfbd1d3b4bcf63c4f90e41ee1794949c6b6a789e82da5239749c9","observation_id":"31711571-15a8-46b5-8922-3baa7e5288d5","resolution":{"observed_at":"2026-08-12T05:01:42.474076Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:01:42.455926Z","title":"Hybrid contrastive learning of tri-modal representation for multimodal sentiment analysis","venue":null,"work_id":"f02223ba-9bae-41b6-8659-e28b66c6ddd0","year":2022},"citing_paper":{"arxiv_id":"2412.00833","last_updated":"2024-12-01T14:47:41Z","snapshot_observed_at":"2026-08-12T06:43:15.732392Z","submitted_at":"2024-12-01T14:47:41Z","title":"AlignMamba: Enhancing Multimodal Mamba with Local and Global Cross-modal Alignment","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T05:01:42.034522Z"},"links":{"citing_paper":"/paper/2412.00833"},"observation_digest":"sha256:c434a6876a4cba5a9b59f6842fc74e17495e23bca291242e1e8c78a709d100cc","observation_id":"0ad9f7c3-af85-4f09-8fe1-3dd234f867a0","resolution":{"observed_at":"2026-08-12T05:01:42.459584Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:01:42.443984Z","title":"Found in translation: Learn- ing robust joint representations by cyclic translations be- tween modalities","venue":null,"work_id":"f3181344-f8ce-462d-876c-c5edd0a10133","year":2019},"citing_paper":{"arxiv_id":"2412.00833","last_updated":"2024-12-01T14:47:41Z","snapshot_observed_at":"2026-08-12T06:43:15.732392Z","submitted_at":"2024-12-01T14:47:41Z","title":"AlignMamba: Enhancing Multimodal Mamba with Local and Global Cross-modal Alignment","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T05:01:42.037973Z"},"links":{"citing_paper":"/paper/2412.00833"},"observation_digest":"sha256:1782f799dd03fd7887b1f2ffd9dee411271313fa827b8e4e6ba8968e7ed59480","observation_id":"b5112029-1712-4d11-995e-20ac6bc27311","resolution":{"observed_at":"2026-08-12T05:01:42.447726Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13600","last_updated":"2024-03-20T13:48:50Z","snapshot_observed_at":"2026-08-10T13:01:51.483664Z","submitted_at":"2024-03-20T13:48:50Z","title":"VL-Mamba: Exploring State Space Models for Multimodal Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13600","snapshot_observed_at":"2026-08-12T05:01:42.042452Z","title":"Vl-mamba: Ex- ploring state space models for multimodal learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.00833","last_updated":"2024-12-01T14:47:41Z","snapshot_observed_at":"2026-08-12T06:43:15.732392Z","submitted_at":"2024-12-01T14:47:41Z","title":"AlignMamba: Enhancing Multimodal Mamba with Local and Global Cross-modal Alignment","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T05:01:42.042452Z"},"links":{"cited_paper":"/paper/2403.13600","citing_paper":"/paper/2412.00833"},"observation_digest":"sha256:29bf9573326f18079a924d34bf5eef59b8e71eb06eaf5e5ca63388845cc2507d","observation_id":"9fb8ad64-fb0e-49a7-85c7-c0776674eb82","resolution":{"observed_at":"2026-08-12T05:01:42.042452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:01:42.432657Z","title":"Integrating multimodal information in large pre- 9 trained transformers","venue":null,"work_id":"e4de0504-54bb-400b-a924-d0be65703afb","year":2020},"citing_paper":{"arxiv_id":"2412.00833","last_updated":"2024-12-01T14:47:41Z","snapshot_observed_at":"2026-08-12T06:43:15.732392Z","submitted_at":"2024-12-01T14:47:41Z","title":"AlignMamba: Enhancing Multimodal Mamba with Local and Global Cross-modal Alignment","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T05:01:42.045943Z"},"links":{"citing_paper":"/paper/2412.00833"},"observation_digest":"sha256:15c307c069199e84029d869dfa4cdf3326c5c870a1f08e5d3bb5da55d1d70706","observation_id":"96709eca-2b8e-4263-a8df-34f7ffac5430","resolution":{"observed_at":"2026-08-12T05:01:42.436455Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:01:42.421602Z","title":"Learning relationships between text, audio, and video via deep canonical correlation for multimodal lan- guage analysis","venue":null,"work_id":"af49272e-bacd-46a1-b259-73d6219306db","year":2020},"citing_paper":{"arxiv_id":"2412.00833","last_updated":"2024-12-01T14:47:41Z","snapshot_observed_at":"2026-08-12T06:43:15.732392Z","submitted_at":"2024-12-01T14:47:41Z","title":"AlignMamba: Enhancing Multimodal Mamba with Local and Global Cross-modal Alignment","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T05:01:42.049642Z"},"links":{"citing_paper":"/paper/2412.00833"},"observation_digest":"sha256:1f2d1dba9dc4928966ccbe101b4bab4d64869584b2959d31276d8f584e687d61","observation_id":"c277438e-c1b2-405b-9872-16de0d810d4c","resolution":{"observed_at":"2026-08-12T05:01:42.425437Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.07490","last_updated":"2019-12-03T19:30:19Z","snapshot_observed_at":"2026-08-10T05:13:08.988270Z","submitted_at":"2019-08-20T17:05:18Z","title":"LXMERT: Learning Cross-Modality Encoder Representations from Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.07490","snapshot_observed_at":"2026-08-12T05:01:42.053369Z","title":"Lxmert: Learning cross- modality encoder representations from transformers","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2412.00833","last_updated":"2024-12-01T14:47:41Z","snapshot_observed_at":"2026-08-12T06:43:15.732392Z","submitted_at":"2024-12-01T14:47:41Z","title":"AlignMamba: Enhancing Multimodal Mamba with Local and Global Cross-modal Alignment","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T05:01:42.053369Z"},"links":{"cited_paper":"/paper/1908.07490","citing_paper":"/paper/2412.00833"},"observation_digest":"sha256:b05c9d4907274607c2c9114d200ca006a0af57597c55f8a502b64e61d2e711c0","observation_id":"b2508153-d1a4-4198-84bf-9a1a1971b3b8","resolution":{"observed_at":"2026-08-12T05:01:42.053369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:01:42.409920Z","title":"Multimodal transformer for unaligned multimodal language sequences","venue":null,"work_id":"1b7ad128-b679-4014-bd15-f7ad1a1f405b","year":2019},"citing_paper":{"arxiv_id":"2412.00833","last_updated":"2024-12-01T14:47:41Z","snapshot_observed_at":"2026-08-12T06:43:15.732392Z","submitted_at":"2024-12-01T14:47:41Z","title":"AlignMamba: Enhancing Multimodal Mamba with Local and Global Cross-modal Alignment","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T05:01:42.057415Z"},"links":{"citing_paper":"/paper/2412.00833"},"observation_digest":"sha256:1c7db618715fb524f93b3a579a7ed976eb51439126bfa136a72bdaf01902dadb","observation_id":"adae3bc6-2d01-40cc-a6a7-7b07767c92a7","resolution":{"observed_at":"2026-08-12T05:01:42.414061Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:01:42.060642Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.00833","last_updated":"2024-12-01T14:47:41Z","snapshot_observed_at":"2026-08-12T06:43:15.732392Z","submitted_at":"2024-12-01T14:47:41Z","title":"AlignMamba: Enhancing Multimodal Mamba with Local and Global Cross-modal Alignment","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T05:01:42.060642Z"},"links":{"citing_paper":"/paper/2412.00833"},"observation_digest":"sha256:b4fc838280425522743c0d9303ebca38ae8a6f10099e13c4f457aca541da4958","observation_id":"c8997965-6f18-4823-968f-a6970a065e09","resolution":{"observed_at":"2026-08-12T05:01:42.060642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:01:42.391200Z","title":"Topics in optimal transportation","venue":null,"work_id":"d1c79c1e-ba91-4b49-8a20-d828529eca1d","year":2021},"citing_paper":{"arxiv_id":"2412.00833","last_updated":"2024-12-01T14:47:41Z","snapshot_observed_at":"2026-08-12T06:43:15.732392Z","submitted_at":"2024-12-01T14:47:41Z","title":"AlignMamba: Enhancing Multimodal Mamba with Local and Global Cross-modal Alignment","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T05:01:42.063972Z"},"links":{"citing_paper":"/paper/2412.00833"},"observation_digest":"sha256:6afacb68f354b18dd30e96faaf20db5e4bd0624a516c66b091fc988319e9eab3","observation_id":"067b3d1c-fe15-4631-b28d-7bd2b0650fa8","resolution":{"observed_at":"2026-08-12T05:01:42.395010Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:01:42.380549Z","title":"On deep multi-view representation learning","venue":null,"work_id":"a2fa830f-ed21-46d8-b084-289a55c25754","year":null},"citing_paper":{"arxiv_id":"2412.00833","last_updated":"2024-12-01T14:47:41Z","snapshot_observed_at":"2026-08-12T06:43:15.732392Z","submitted_at":"2024-12-01T14:47:41Z","title":"AlignMamba: Enhancing Multimodal Mamba with Local and Global Cross-modal Alignment","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T05:01:42.067144Z"},"links":{"citing_paper":"/paper/2412.00833"},"observation_digest":"sha256:90cbb02c76fb56b45a80b46eee0e370a63a36780218d89625f2de97ae3084535","observation_id":"87b52633-a1a8-4f2e-b86a-8f47fcbdb6ec","resolution":{"observed_at":"2026-08-12T05:01:42.384298Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:01:42.368796Z","title":"Incomplete multimodality-diffused emotion recognition","venue":null,"work_id":"1d2bfbf3-ed81-4751-9414-98a00f19e86b","year":2024},"citing_paper":{"arxiv_id":"2412.00833","last_updated":"2024-12-01T14:47:41Z","snapshot_observed_at":"2026-08-12T06:43:15.732392Z","submitted_at":"2024-12-01T14:47:41Z","title":"AlignMamba: Enhancing Multimodal Mamba with Local and Global Cross-modal Alignment","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T05:01:42.070705Z"},"links":{"citing_paper":"/paper/2412.00833"},"observation_digest":"sha256:be6727329b0ee0bacd3203dccb4556be7844ce42b28bfb9f158acaddf85dd78e","observation_id":"ee1dd380-7251-4c9d-94fe-3e8bf9e43436","resolution":{"observed_at":"2026-08-12T05:01:42.372352Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:01:42.357285Z","title":"Disentangled representation learning for multimodal emotion recognition","venue":null,"work_id":"27f1fbfc-d8d2-430f-a854-639e3ddca5a9","year":2022},"citing_paper":{"arxiv_id":"2412.00833","last_updated":"2024-12-01T14:47:41Z","snapshot_observed_at":"2026-08-12T06:43:15.732392Z","submitted_at":"2024-12-01T14:47:41Z","title":"AlignMamba: Enhancing Multimodal Mamba with Local and Global Cross-modal Alignment","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T05:01:42.074457Z"},"links":{"citing_paper":"/paper/2412.00833"},"observation_digest":"sha256:98788380dc6bdb88199dfa06dfb207378f128567d77d62448e10998d15e3f286","observation_id":"16a98618-ecaa-4cec-9eeb-c60cba74d619","resolution":{"observed_at":"2026-08-12T05:01:42.361087Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:01:42.344339Z","title":"Confede: Contrastive feature decomposition for multimodal sentiment analysis","venue":null,"work_id":"860e5fb6-0732-47d1-8a23-c2a0479e20d2","year":2023},"citing_paper":{"arxiv_id":"2412.00833","last_updated":"2024-12-01T14:47:41Z","snapshot_observed_at":"2026-08-12T06:43:15.732392Z","submitted_at":"2024-12-01T14:47:41Z","title":"AlignMamba: Enhancing Multimodal Mamba with Local and Global Cross-modal Alignment","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T05:01:42.077468Z"},"links":{"citing_paper":"/paper/2412.00833"},"observation_digest":"sha256:c9382867938953263446fb1721660c09dafecb82998fef95e4adad907aa22b9c","observation_id":"8f6be728-4470-463d-9fea-a0376c25cc36","resolution":{"observed_at":"2026-08-12T05:01:42.349173Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:01:42.331284Z","title":"Cm-bert: Cross- modal bert for text-audio sentiment analysis","venue":null,"work_id":"4232886a-5857-4e08-81d2-9431e5aa0aee","year":2020},"citing_paper":{"arxiv_id":"2412.00833","last_updated":"2024-12-01T14:47:41Z","snapshot_observed_at":"2026-08-12T06:43:15.732392Z","submitted_at":"2024-12-01T14:47:41Z","title":"AlignMamba: Enhancing Multimodal Mamba with Local and Global Cross-modal Alignment","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T05:01:42.081395Z"},"links":{"citing_paper":"/paper/2412.00833"},"observation_digest":"sha256:3c7afecca0ec1301eae5b71cde1dda7e62f4a0fd440c8c0607303470f4cdbcf1","observation_id":"60cf3e8f-17bb-449a-9df8-019d61553883","resolution":{"observed_at":"2026-08-12T05:01:42.335547Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:01:42.319474Z","title":"Learning modality-specific representations with self-supervised multi- task learning for multimodal sentiment analysis","venue":null,"work_id":"9110db23-7413-4a91-8ecc-129e56f6f592","year":2021},"citing_paper":{"arxiv_id":"2412.00833","last_updated":"2024-12-01T14:47:41Z","snapshot_observed_at":"2026-08-12T06:43:15.732392Z","submitted_at":"2024-12-01T14:47:41Z","title":"AlignMamba: Enhancing Multimodal Mamba with Local and Global Cross-modal Alignment","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T05:01:42.084982Z"},"links":{"citing_paper":"/paper/2412.00833"},"observation_digest":"sha256:8fe83df43dbf10d3d4a6d5ea85f2c384e72699cda1d700c3be50e89cb33b5291","observation_id":"01ac51c7-95d3-4afa-ba50-1c42d09114b2","resolution":{"observed_at":"2026-08-12T05:01:42.323364Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1606.06259","last_updated":"2016-08-12T02:39:40Z","snapshot_observed_at":"2026-07-06T05:00:39.739374Z","submitted_at":"2016-06-20T19:23:53Z","title":"MOSI: Multimodal Corpus of Sentiment Intensity and Subjectivity Analysis in Online Opinion Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.06259","snapshot_observed_at":"2026-08-12T05:01:42.088413Z","title":"Mosi: multimodal corpus of sentiment intensity and subjectivity analysis in online opinion videos","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.00833","last_updated":"2024-12-01T14:47:41Z","snapshot_observed_at":"2026-08-12T06:43:15.732392Z","submitted_at":"2024-12-01T14:47:41Z","title":"AlignMamba: Enhancing Multimodal Mamba with Local and Global Cross-modal Alignment","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T05:01:42.088413Z"},"links":{"cited_paper":"/paper/1606.06259","citing_paper":"/paper/2412.00833"},"observation_digest":"sha256:24f6379127c5fb3dd1048325932a3619f46d76d0bf3e10746b7c0070c4e347cb","observation_id":"809d18a8-083f-4668-86e4-ecbe3c3fecb1","resolution":{"observed_at":"2026-08-12T05:01:42.088413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:01:42.308230Z","title":"Multimodal lan- guage analysis in the wild: Cmu-mosei dataset and inter- pretable dynamic fusion graph","venue":null,"work_id":"3ed63465-f2a4-4fa3-8d47-4f0c504623ed","year":2018},"citing_paper":{"arxiv_id":"2412.00833","last_updated":"2024-12-01T14:47:41Z","snapshot_observed_at":"2026-08-12T06:43:15.732392Z","submitted_at":"2024-12-01T14:47:41Z","title":"AlignMamba: Enhancing Multimodal Mamba with Local and Global Cross-modal Alignment","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T05:01:42.092694Z"},"links":{"citing_paper":"/paper/2412.00833"},"observation_digest":"sha256:3efc25e10ff3aeae53a2749e563013c19bc9af19540ffa241d6b089e355b70ca","observation_id":"ca304666-e2eb-4617-aaef-1378ae6c753c","resolution":{"observed_at":"2026-08-12T05:01:42.311854Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-08-11T00:52:12.225793Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-12T05:01:42.096439Z","title":"Multimodal chain-of- thought reasoning in language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.00833","last_updated":"2024-12-01T14:47:41Z","snapshot_observed_at":"2026-08-12T06:43:15.732392Z","submitted_at":"2024-12-01T14:47:41Z","title":"AlignMamba: Enhancing Multimodal Mamba with Local and Global Cross-modal Alignment","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T05:01:42.096439Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2412.00833"},"observation_digest":"sha256:9c2547c90abc9f381caef76e283ac8bd86f6b64dd4e2afa45fb03aaed4e0c62f","observation_id":"c4a0ecc7-4fbb-489f-a92c-ac9a8c703875","resolution":{"observed_at":"2026-08-12T05:01:42.096439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.14520","last_updated":"2025-01-08T11:03:00Z","snapshot_observed_at":"2026-08-11T14:47:00.895723Z","submitted_at":"2024-03-21T16:17:57Z","title":"Cobra: Extending Mamba to Multi-Modal Large Language Model for Efficient Inference","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.14520","snapshot_observed_at":"2026-08-12T05:01:42.100140Z","title":"Cobra: Extending mamba to multi-modal large language model for efficient inference","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.00833","last_updated":"2024-12-01T14:47:41Z","snapshot_observed_at":"2026-08-12T06:43:15.732392Z","submitted_at":"2024-12-01T14:47:41Z","title":"AlignMamba: Enhancing Multimodal Mamba with Local and Global Cross-modal Alignment","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T05:01:42.100140Z"},"links":{"cited_paper":"/paper/2403.14520","citing_paper":"/paper/2412.00833"},"observation_digest":"sha256:38cc77719d2bc7ebbc802675b4812e5297c6a678f78a06e8256e3f102de7d794","observation_id":"98119993-07de-4d9e-8ec8-c45659f2cd84","resolution":{"observed_at":"2026-08-12T05:01:42.100140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:01:42.296639Z","title":"Missing modal- ity imagination network for emotion recognition with un- certain missing modalities","venue":null,"work_id":"72b86f05-f55a-4fae-a548-171621287474","year":2021},"citing_paper":{"arxiv_id":"2412.00833","last_updated":"2024-12-01T14:47:41Z","snapshot_observed_at":"2026-08-12T06:43:15.732392Z","submitted_at":"2024-12-01T14:47:41Z","title":"AlignMamba: Enhancing Multimodal Mamba with Local and Global Cross-modal Alignment","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T05:01:42.103755Z"},"links":{"citing_paper":"/paper/2412.00833"},"observation_digest":"sha256:4e38d49cf5b6b92fb369c1fb6fc4ab4cc0826d676f3951b0f2ff546227d58bd1","observation_id":"544108e8-c41f-4bec-bdf0-9a73f9814453","resolution":{"observed_at":"2026-08-12T05:01:42.300682Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:01:42.283597Z","title":"Multi-channel weight-sharing autoencoder based on cascade multi-head attention for multimodal emo- tion recognition","venue":null,"work_id":"c6c0e241-8a9f-4d1e-879a-fd0010635783","year":2022},"citing_paper":{"arxiv_id":"2412.00833","last_updated":"2024-12-01T14:47:41Z","snapshot_observed_at":"2026-08-12T06:43:15.732392Z","submitted_at":"2024-12-01T14:47:41Z","title":"AlignMamba: Enhancing Multimodal Mamba with Local and Global Cross-modal Alignment","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T05:01:42.107189Z"},"links":{"citing_paper":"/paper/2412.00833"},"observation_digest":"sha256:868400d277f82e23655441c361e5bfbdd41ad4d3f0cddd6c490a8a3df6fe2f1a","observation_id":"d0c59910-91d5-427e-91e9-3a462b137ae8","resolution":{"observed_at":"2026-08-12T05:01:42.289235Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.00833","last_updated":"2024-12-01T14:47:41Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-12T06:43:15.732392Z","submitted_at":"2024-12-01T14:47:41Z","title":"AlignMamba: Enhancing Multimodal Mamba with Local and Global Cross-modal Alignment"},"reference_resolution":{"displayed":44,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":16,"verified_exact":0,"verified_fuzzy":28},"total_outbound_references":44},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 44 of 44 outbound references and 0 inbound Pith citation observations for arXiv:2412.00833."}