{"as_of":"2026-08-11T15:53:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1107ba3483685fa8abfa33511f44db04e343ca37f723a3e23aafda6510c35989","coverage":[{"denominator":47,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":47,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T21:52:25.017468Z","state":"measured"},{"denominator":48,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":48,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-11T23:54:32.839280Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.07803","last_updated":"2025-08-11T09:39:16Z","snapshot_observed_at":"2026-08-05T21:52:13.064226Z","submitted_at":"2025-08-11T09:39:16Z","title":"MambaTrans: Multimodal Fusion Image Translation via Large Language Model Priors for Downstream Visual Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.07803","snapshot_observed_at":"2026-07-11T23:54:32.839280Z","title":"arXiv preprint arXiv:2508.07803 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03795","last_updated":"2026-07-04T09:49:53Z","snapshot_observed_at":"2026-08-03T21:02:19.163656Z","submitted_at":"2026-07-04T09:49:53Z","title":"InfraNet: Quality-Aware RGB Guidance for Efficient Infrared Object Detection","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-07-11T23:54:32.839280Z"},"links":{"cited_paper":"/paper/2508.07803","citing_paper":"/paper/2607.03795"},"observation_digest":"sha256:ce5b1f9c9ae41137ff1e3a3b445bb2284fd09346f4229390cc51fc71d431f2fe","observation_id":"8186a886-802d-47e0-bb27-ebe0460eea66","resolution":{"observed_at":"2026-07-11T23:54:32.839280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2508.07803/citation-record","integrity":"/paper/2508.07803/integrity","json":"/paper/2508.07803/citation-record.json","paper":"/paper/2508.07803"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:52:33.842585Z","title":"A deep learning framework for infrared and visible image fusion without strict registration","venue":null,"work_id":"6f1d63cc-5c68-4f15-812a-99b21408e113","year":2024},"citing_paper":{"arxiv_id":"2508.07803","last_updated":"2025-08-11T09:39:16Z","snapshot_observed_at":"2026-08-05T21:52:13.064226Z","submitted_at":"2025-08-11T09:39:16Z","title":"MambaTrans: Multimodal Fusion Image Translation via Large Language Model Priors for Downstream Visual Tasks","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-05T21:52:20.843522Z"},"links":{"citing_paper":"/paper/2508.07803"},"observation_digest":"sha256:0cf023ac04482b5bc15570049486ab3abe88f901b2f606387c56828d9bf75c6a","observation_id":"168e4721-7e28-416b-8eea-e6e21ab8983a","resolution":{"observed_at":"2026-08-05T21:52:33.914320Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:52:20.944258Z","title":"All-weather multi-modality image fusion: Unified framework and 100k benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.07803","last_updated":"2025-08-11T09:39:16Z","snapshot_observed_at":"2026-08-05T21:52:13.064226Z","submitted_at":"2025-08-11T09:39:16Z","title":"MambaTrans: Multimodal Fusion Image Translation via Large Language Model Priors for Downstream Visual Tasks","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-05T21:52:20.944258Z"},"links":{"citing_paper":"/paper/2508.07803"},"observation_digest":"sha256:a7d1d8a8e9509b2cd813944dc5d0a872e1a2d4dbe5a8165cf39b3102fc285bba","observation_id":"a5777d18-1a03-47f1-8b16-353c70a1a5b0","resolution":{"observed_at":"2026-08-05T21:52:20.944258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:52:33.648060Z","title":"Infrared and visible image fusion based on domain transform filtering and sparse representation","venue":null,"work_id":"b79df575-61cb-4b9b-9508-9ec96b216815","year":2023},"citing_paper":{"arxiv_id":"2508.07803","last_updated":"2025-08-11T09:39:16Z","snapshot_observed_at":"2026-08-05T21:52:13.064226Z","submitted_at":"2025-08-11T09:39:16Z","title":"MambaTrans: Multimodal Fusion Image Translation via Large Language Model Priors for Downstream Visual Tasks","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-05T21:52:21.052336Z"},"links":{"citing_paper":"/paper/2508.07803"},"observation_digest":"sha256:57c3f35b4413047d8064be6db11b46782461e144941a1fb7e71bbd8e8804fa7d","observation_id":"50ddb353-3e72-4768-adcb-9ec1833028c3","resolution":{"observed_at":"2026-08-05T21:52:33.758344Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:52:33.443796Z","title":"Infrared and visible image fusion: From data compatibility to task adaption","venue":null,"work_id":"bbbd47db-f230-42d9-8b64-30c5ce46318f","year":2024},"citing_paper":{"arxiv_id":"2508.07803","last_updated":"2025-08-11T09:39:16Z","snapshot_observed_at":"2026-08-05T21:52:13.064226Z","submitted_at":"2025-08-11T09:39:16Z","title":"MambaTrans: Multimodal Fusion Image Translation via Large Language Model Priors for Downstream Visual Tasks","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-05T21:52:21.160857Z"},"links":{"citing_paper":"/paper/2508.07803"},"observation_digest":"sha256:dffd5a5408a45b2c932d676afce7faaec6458bb5e534a0f06a005855277c1f12","observation_id":"f646ed0c-ad4d-4340-860a-01556952b60f","resolution":{"observed_at":"2026-08-05T21:52:33.536389Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:52:33.194928Z","title":"Simultaneous tri-modal medical image fusion and super-resolution using conditional diffusion model","venue":null,"work_id":"1558ba6f-8736-4a4b-ba2f-a6dade21258d","year":2024},"citing_paper":{"arxiv_id":"2508.07803","last_updated":"2025-08-11T09:39:16Z","snapshot_observed_at":"2026-08-05T21:52:13.064226Z","submitted_at":"2025-08-11T09:39:16Z","title":"MambaTrans: Multimodal Fusion Image Translation via Large Language Model Priors for Downstream Visual Tasks","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-05T21:52:21.259991Z"},"links":{"citing_paper":"/paper/2508.07803"},"observation_digest":"sha256:29b8c2c1c9705096be32c5e6101f074935dc7559aef92834690e504e92de4238","observation_id":"9e8b1584-9e0b-4dbf-8c83-bc5edf9765eb","resolution":{"observed_at":"2026-08-05T21:52:33.295541Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:52:32.922363Z","title":"Fast r-cnn","venue":null,"work_id":"4b87ce14-5650-423e-b486-4616535ef775","year":2015},"citing_paper":{"arxiv_id":"2508.07803","last_updated":"2025-08-11T09:39:16Z","snapshot_observed_at":"2026-08-05T21:52:13.064226Z","submitted_at":"2025-08-11T09:39:16Z","title":"MambaTrans: Multimodal Fusion Image Translation via Large Language Model Priors for Downstream Visual Tasks","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-05T21:52:21.481919Z"},"links":{"citing_paper":"/paper/2508.07803"},"observation_digest":"sha256:df33257ca31ba07f41e583ad1dcb83caddda9869303fc6a0d4cd84a4241a6b5f","observation_id":"f2d9ac42-ac80-4ce0-bf67-5b308133d718","resolution":{"observed_at":"2026-08-05T21:52:33.066319Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:52:32.758337Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":"ecaa8948-bef6-4cc2-8002-2d5549c47ccb","year":2014},"citing_paper":{"arxiv_id":"2508.07803","last_updated":"2025-08-11T09:39:16Z","snapshot_observed_at":"2026-08-05T21:52:13.064226Z","submitted_at":"2025-08-11T09:39:16Z","title":"MambaTrans: Multimodal Fusion Image Translation via Large Language Model Priors for Downstream Visual Tasks","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-05T21:52:21.572846Z"},"links":{"citing_paper":"/paper/2508.07803"},"observation_digest":"sha256:8288ea69ac53114c729d6e19c9774713195834e3d4aebb073fe3d24c7e812efc","observation_id":"f8ae765a-2b45-451b-a981-b47b86160e2c","resolution":{"observed_at":"2026-08-05T21:52:32.837681Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:52:21.713153Z","title":"Visualizing data using t-sne","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2508.07803","last_updated":"2025-08-11T09:39:16Z","snapshot_observed_at":"2026-08-05T21:52:13.064226Z","submitted_at":"2025-08-11T09:39:16Z","title":"MambaTrans: Multimodal Fusion Image Translation via Large Language Model Priors for Downstream Visual Tasks","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-05T21:52:21.713153Z"},"links":{"citing_paper":"/paper/2508.07803"},"observation_digest":"sha256:272a9acdf88234de19812066e8962bc7643cdbda3fadffa1855582b63ac71647","observation_id":"95698043-7484-408d-aca9-888a1a635f15","resolution":{"observed_at":"2026-08-05T21:52:21.713153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:52:21.795023Z","title":"Tsjnet: A multi-modality target and semantic awareness joint-driven image fusion network","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.07803","last_updated":"2025-08-11T09:39:16Z","snapshot_observed_at":"2026-08-05T21:52:13.064226Z","submitted_at":"2025-08-11T09:39:16Z","title":"MambaTrans: Multimodal Fusion Image Translation via Large Language Model Priors for Downstream Visual Tasks","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-05T21:52:21.795023Z"},"links":{"citing_paper":"/paper/2508.07803"},"observation_digest":"sha256:5d4b41da68f76e123024762f56adaa4e42ab3d45170c8d0f4c0b199b7b066103","observation_id":"3dc53547-8931-4a95-a8f5-f46167226cb4","resolution":{"observed_at":"2026-08-05T21:52:21.795023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:52:32.511751Z","title":"Target-aware dual adversarial learning and a multi-scenario multi-modality benchmark to fuse infrared and visible for object detection","venue":null,"work_id":"8a4e775c-b534-46fa-b1df-1e69925365b7","year":2022},"citing_paper":{"arxiv_id":"2508.07803","last_updated":"2025-08-11T09:39:16Z","snapshot_observed_at":"2026-08-05T21:52:13.064226Z","submitted_at":"2025-08-11T09:39:16Z","title":"MambaTrans: Multimodal Fusion Image Translation via Large Language Model Priors for Downstream Visual Tasks","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-05T21:52:21.874881Z"},"links":{"citing_paper":"/paper/2508.07803"},"observation_digest":"sha256:fa4c528f8baa64b225676188aa90f8fffef2b226e5690cff70920d05457a7374","observation_id":"5957c9c7-fda6-4c8a-8295-3b4d8b2673e0","resolution":{"observed_at":"2026-08-05T21:52:32.653248Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:52:32.321784Z","title":"Fs-diff: Semantic guidance and clarity-aware simultaneous multimodal image fusion and super-resolution","venue":null,"work_id":"0d7f16b3-f2bc-44d4-929e-4897ebaf615a","year":2025},"citing_paper":{"arxiv_id":"2508.07803","last_updated":"2025-08-11T09:39:16Z","snapshot_observed_at":"2026-08-05T21:52:13.064226Z","submitted_at":"2025-08-11T09:39:16Z","title":"MambaTrans: Multimodal Fusion Image Translation via Large Language Model Priors for Downstream Visual Tasks","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-05T21:52:21.983819Z"},"links":{"citing_paper":"/paper/2508.07803"},"observation_digest":"sha256:5dfeec053b4610e75708d8e447550ba375b4c2d8429b447bd4511cbc98199814","observation_id":"0baafcb8-965e-4a87-9a73-8d1f3a5b69ed","resolution":{"observed_at":"2026-08-05T21:52:32.377319Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:52:32.162842Z","title":"A task-guided, implicitly-searched and metainitialized deep model for image fusion","venue":null,"work_id":"cb727e39-1d80-4b4a-89d1-a07224a84e6a","year":2024},"citing_paper":{"arxiv_id":"2508.07803","last_updated":"2025-08-11T09:39:16Z","snapshot_observed_at":"2026-08-05T21:52:13.064226Z","submitted_at":"2025-08-11T09:39:16Z","title":"MambaTrans: Multimodal Fusion Image Translation via Large Language Model Priors for Downstream Visual Tasks","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-05T21:52:22.083478Z"},"links":{"citing_paper":"/paper/2508.07803"},"observation_digest":"sha256:01cd71e74b5f0c545176b0881c6bc8a3c3ae27ea224e26e646f878ec961cf4b2","observation_id":"f2a1e272-e385-4dd3-bc79-ab46406dff3e","resolution":{"observed_at":"2026-08-05T21:52:32.242375Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:52:31.897495Z","title":"Image fusion in the loop of high-level vision tasks: A semantic-aware real-time infrared and visible image fusion network","venue":null,"work_id":"7e8fd9d5-07b0-489f-8fa5-f36533940ec0","year":2022},"citing_paper":{"arxiv_id":"2508.07803","last_updated":"2025-08-11T09:39:16Z","snapshot_observed_at":"2026-08-05T21:52:13.064226Z","submitted_at":"2025-08-11T09:39:16Z","title":"MambaTrans: Multimodal Fusion Image Translation via Large Language Model Priors for Downstream Visual Tasks","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-05T21:52:22.190602Z"},"links":{"citing_paper":"/paper/2508.07803"},"observation_digest":"sha256:76428a868f0d862e1044ab72edfdb92801606fd7de92e5a023f1a73e374bced3","observation_id":"330debc3-4de8-4489-87c9-cdf7d6008795","resolution":{"observed_at":"2026-08-05T21:52:32.072413Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:52:31.685989Z","title":"Mrfs: Mutually reinforcing image fusion and segmentation","venue":null,"work_id":"93e031ae-e877-412c-b69e-51483432b98b","year":2024},"citing_paper":{"arxiv_id":"2508.07803","last_updated":"2025-08-11T09:39:16Z","snapshot_observed_at":"2026-08-05T21:52:13.064226Z","submitted_at":"2025-08-11T09:39:16Z","title":"MambaTrans: Multimodal Fusion Image Translation via Large Language Model Priors for Downstream Visual Tasks","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-05T21:52:22.300125Z"},"links":{"citing_paper":"/paper/2508.07803"},"observation_digest":"sha256:e94399b56f9ffd0ff39b9331b9fd10aec0a9e8f9d7983b34d2a009ad6cdeb433","observation_id":"e1cbd90c-fd38-4701-8161-0ce3eb1aa078","resolution":{"observed_at":"2026-08-05T21:52:31.755632Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:52:31.496506Z","title":"Image-to-image translation: Methods and applications","venue":null,"work_id":"d5a0f82c-b865-4f80-b88f-a3e29ee8da19","year":2021},"citing_paper":{"arxiv_id":"2508.07803","last_updated":"2025-08-11T09:39:16Z","snapshot_observed_at":"2026-08-05T21:52:13.064226Z","submitted_at":"2025-08-11T09:39:16Z","title":"MambaTrans: Multimodal Fusion Image Translation via Large Language Model Priors for Downstream Visual Tasks","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-05T21:52:22.415638Z"},"links":{"citing_paper":"/paper/2508.07803"},"observation_digest":"sha256:805a946c748b3623dd490cac480088e8e117bd80ad030a3677abed9e8a10ab90","observation_id":"3fa7d815-f3a3-414c-9f10-8e61c88de446","resolution":{"observed_at":"2026-08-05T21:52:31.569164Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:52:31.182279Z","title":"Source-free open compound domain adaptation in semantic segmentation","venue":null,"work_id":"aa2923f0-34d1-4d16-bd33-745056586c72","year":2022},"citing_paper":{"arxiv_id":"2508.07803","last_updated":"2025-08-11T09:39:16Z","snapshot_observed_at":"2026-08-05T21:52:13.064226Z","submitted_at":"2025-08-11T09:39:16Z","title":"MambaTrans: Multimodal Fusion Image Translation via Large Language Model Priors for Downstream Visual Tasks","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-05T21:52:22.499013Z"},"links":{"citing_paper":"/paper/2508.07803"},"observation_digest":"sha256:1853951d7e0b44ccdf67ba60a1585cc47c44cbfeaea7efacdef33ec0d93c5020","observation_id":"628f808a-9b94-4aa0-9ef2-77bf7ac7885a","resolution":{"observed_at":"2026-08-05T21:52:31.357536Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:52:30.988210Z","title":"Infragan: A gan architecture to transfer visible images to infrared domain","venue":null,"work_id":"5314dd52-1fab-491f-ae59-013a20d28777","year":2022},"citing_paper":{"arxiv_id":"2508.07803","last_updated":"2025-08-11T09:39:16Z","snapshot_observed_at":"2026-08-05T21:52:13.064226Z","submitted_at":"2025-08-11T09:39:16Z","title":"MambaTrans: Multimodal Fusion Image Translation via Large Language Model Priors for Downstream Visual Tasks","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-05T21:52:22.571106Z"},"links":{"citing_paper":"/paper/2508.07803"},"observation_digest":"sha256:37571659eae11be0181d84469553b459fd8de5fc6f4ee92ad7b49f427e0645dc","observation_id":"0d2eabd2-5c76-49ee-ac91-80f5a3b7dafb","resolution":{"observed_at":"2026-08-05T21:52:31.076644Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:52:30.798025Z","title":"Cnn-based thermal infrared person detection by domain adaptation","venue":null,"work_id":"e81db1db-ad91-429e-9296-eda563a7ca76","year":2018},"citing_paper":{"arxiv_id":"2508.07803","last_updated":"2025-08-11T09:39:16Z","snapshot_observed_at":"2026-08-05T21:52:13.064226Z","submitted_at":"2025-08-11T09:39:16Z","title":"MambaTrans: Multimodal Fusion Image Translation via Large Language Model Priors for Downstream Visual Tasks","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-05T21:52:22.633845Z"},"links":{"citing_paper":"/paper/2508.07803"},"observation_digest":"sha256:07abcd134f930f1e2cc7905cf71d46f6da07e0e56450e4d2ee19186d5eca6a0e","observation_id":"37b2628c-cfeb-4652-a9a3-197fa0478a0b","resolution":{"observed_at":"2026-08-05T21:52:30.887222Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:52:30.598062Z","title":"Hallucidet: hallucinating rgb modality for person detection through privileged information","venue":null,"work_id":"fbf37925-364c-476a-aec3-d05f4e3cd141","year":2024},"citing_paper":{"arxiv_id":"2508.07803","last_updated":"2025-08-11T09:39:16Z","snapshot_observed_at":"2026-08-05T21:52:13.064226Z","submitted_at":"2025-08-11T09:39:16Z","title":"MambaTrans: Multimodal Fusion Image Translation via Large Language Model Priors for Downstream Visual Tasks","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-05T21:52:22.737979Z"},"links":{"citing_paper":"/paper/2508.07803"},"observation_digest":"sha256:faf261c7e1707bd2c920bd6a25fe64de7f354117565af309d364c5ce574a3871","observation_id":"56bfd79f-6e98-45f7-974b-c32740ef96a2","resolution":{"observed_at":"2026-08-05T21:52:30.699864Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:52:30.385431Z","title":"Modality translation for object detection adaptation without forgetting prior knowledge","venue":null,"work_id":"74bf2efd-bf94-4145-a144-ad86f1d795b9","year":2024},"citing_paper":{"arxiv_id":"2508.07803","last_updated":"2025-08-11T09:39:16Z","snapshot_observed_at":"2026-08-05T21:52:13.064226Z","submitted_at":"2025-08-11T09:39:16Z","title":"MambaTrans: Multimodal Fusion Image Translation via Large Language Model Priors for Downstream Visual Tasks","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-05T21:52:22.812104Z"},"links":{"citing_paper":"/paper/2508.07803"},"observation_digest":"sha256:a8b2bcfddae7d5040f723d9b8650b4b8214846cb7a4c2b5aff914ff8bf26ea9b","observation_id":"7a470abe-68f6-4c2d-ac65-ed82df8276a5","resolution":{"observed_at":"2026-08-05T21:52:30.456942Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00752","last_updated":"2024-05-31T17:55:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-01T18:01:34Z","title":"Mamba: Linear-Time Sequence Modeling with Selective State Spaces","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.00752","snapshot_observed_at":"2026-08-05T21:52:22.912267Z","title":"Mamba: Linear-time sequence modeling with selective state spaces","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.07803","last_updated":"2025-08-11T09:39:16Z","snapshot_observed_at":"2026-08-05T21:52:13.064226Z","submitted_at":"2025-08-11T09:39:16Z","title":"MambaTrans: Multimodal Fusion Image Translation via Large Language Model Priors for Downstream Visual Tasks","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-05T21:52:22.912267Z"},"links":{"cited_paper":"/paper/2312.00752","citing_paper":"/paper/2508.07803"},"observation_digest":"sha256:7a1cd012dd46dbffe0d95eec7c1c19c92869802d481ec93c5672f35fe24749e5","observation_id":"42e047fa-8044-48e9-8f00-d3fc651b7201","resolution":{"observed_at":"2026-08-05T21:52:22.912267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:52:30.140937Z","title":"Vmamba: Visual state space model","venue":null,"work_id":"e53072c0-29a8-4eeb-bf9d-74baa7ed89f6","year":2024},"citing_paper":{"arxiv_id":"2508.07803","last_updated":"2025-08-11T09:39:16Z","snapshot_observed_at":"2026-08-05T21:52:13.064226Z","submitted_at":"2025-08-11T09:39:16Z","title":"MambaTrans: Multimodal Fusion Image Translation via Large Language Model Priors for Downstream Visual Tasks","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-05T21:52:22.998893Z"},"links":{"citing_paper":"/paper/2508.07803"},"observation_digest":"sha256:523116a32f992d4eb7eb412fb8344b7e74bd3c4c60a226bbda1f5c299b6e8981","observation_id":"a5d5d2c5-e078-4562-b432-69a715a0aae2","resolution":{"observed_at":"2026-08-05T21:52:30.269904Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:52:29.889293Z","title":"Mambair: A simple baseline for image restoration with state-space model","venue":null,"work_id":"8017d66f-1bbc-4fd4-b780-50e50f7e9783","year":2024},"citing_paper":{"arxiv_id":"2508.07803","last_updated":"2025-08-11T09:39:16Z","snapshot_observed_at":"2026-08-05T21:52:13.064226Z","submitted_at":"2025-08-11T09:39:16Z","title":"MambaTrans: Multimodal Fusion Image Translation via Large Language Model Priors for Downstream Visual Tasks","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-05T21:52:23.077544Z"},"links":{"citing_paper":"/paper/2508.07803"},"observation_digest":"sha256:b3c45af23aff5c39248e6278b053b8104631643113e087c8f75e54ad7ad721d5","observation_id":"e0502ec9-18c2-4fc5-8539-79198965130f","resolution":{"observed_at":"2026-08-05T21:52:30.002559Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:52:29.510291Z","title":"Vision mamba: efficient visual representation learning with bidirectional state space model","venue":null,"work_id":"9ba14be6-4f60-4d4c-adb7-e1ef91e48d08","year":2024},"citing_paper":{"arxiv_id":"2508.07803","last_updated":"2025-08-11T09:39:16Z","snapshot_observed_at":"2026-08-05T21:52:13.064226Z","submitted_at":"2025-08-11T09:39:16Z","title":"MambaTrans: Multimodal Fusion Image Translation via Large Language Model Priors for Downstream Visual Tasks","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-05T21:52:23.182088Z"},"links":{"citing_paper":"/paper/2508.07803"},"observation_digest":"sha256:e3ef6f1f6007a83761d7bdd44426c5130c6e3f4f4dc8341b39bd394516ed0c31","observation_id":"324bcfbb-487b-47e7-ae1e-64013fd9f8a8","resolution":{"observed_at":"2026-08-05T21:52:29.682263Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.05202","last_updated":"2020-02-12T19:57:13Z","snapshot_observed_at":"2026-08-11T06:21:56.129166Z","submitted_at":"2020-02-12T19:57:13Z","title":"GLU Variants Improve Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.05202","snapshot_observed_at":"2026-08-05T21:52:23.234051Z","title":"Glu variants improve transformer","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2508.07803","last_updated":"2025-08-11T09:39:16Z","snapshot_observed_at":"2026-08-05T21:52:13.064226Z","submitted_at":"2025-08-11T09:39:16Z","title":"MambaTrans: Multimodal Fusion Image Translation via Large Language Model Priors for Downstream Visual Tasks","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-05T21:52:23.234051Z"},"links":{"cited_paper":"/paper/2002.05202","citing_paper":"/paper/2508.07803"},"observation_digest":"sha256:8b90697b58f5af83748d9c58dbb18f720abd86d045e9f97a1353aa9ed5b49bbc","observation_id":"6e766b80-804f-4162-839a-63acd56fd705","resolution":{"observed_at":"2026-08-05T21:52:23.234051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:52:23.332065Z","title":"Faster r-cnn: Towards real-time object detection with region proposal networks","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2508.07803","last_updated":"2025-08-11T09:39:16Z","snapshot_observed_at":"2026-08-05T21:52:13.064226Z","submitted_at":"2025-08-11T09:39:16Z","title":"MambaTrans: Multimodal Fusion Image Translation via Large Language Model Priors for Downstream Visual Tasks","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-05T21:52:23.332065Z"},"links":{"citing_paper":"/paper/2508.07803"},"observation_digest":"sha256:7fe4c5a7666ef424221501df43d99fa59ff680bb16f93a7f3175789c1bb35fae","observation_id":"0a9be89a-6367-4f9a-82d8-b1f73f844dfc","resolution":{"observed_at":"2026-08-05T21:52:23.332065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:52:29.251752Z","title":"Piafusion: A progressive infrared and visible image fusion network based on illumination aware","venue":null,"work_id":"fcff7988-1eea-4bae-8518-d721ad2b19fe","year":2022},"citing_paper":{"arxiv_id":"2508.07803","last_updated":"2025-08-11T09:39:16Z","snapshot_observed_at":"2026-08-05T21:52:13.064226Z","submitted_at":"2025-08-11T09:39:16Z","title":"MambaTrans: Multimodal Fusion Image Translation via Large Language Model Priors for Downstream Visual Tasks","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-05T21:52:23.431911Z"},"links":{"citing_paper":"/paper/2508.07803"},"observation_digest":"sha256:333131960351cab817c6488ea811db4b242516dc7438f0037e033a8bfa7d998b","observation_id":"d099b7d5-f44e-47f0-8b07-4acc0cfe7479","resolution":{"observed_at":"2026-08-05T21:52:29.362717Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01210","last_updated":"2025-03-25T07:55:55Z","snapshot_observed_at":"2026-08-07T17:34:45.012344Z","submitted_at":"2025-03-03T06:16:31Z","title":"Every SAM Drop Counts: Embracing Semantic Priors for Multi-Modality Image Fusion and Beyond","version":2},"cited_work":{"arxiv_id":"2503.01210","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.01210","snapshot_observed_at":"2026-08-05T21:52:25.254562Z","title":"Every SAM Drop Counts: Embracing Semantic Priors for Multi-Modality Image Fusion and Beyond","venue":"cs.CV","work_id":"2afec410-3dfe-4992-a770-4b099e6296bc","year":2025},"citing_paper":{"arxiv_id":"2508.07803","last_updated":"2025-08-11T09:39:16Z","snapshot_observed_at":"2026-08-05T21:52:13.064226Z","submitted_at":"2025-08-11T09:39:16Z","title":"MambaTrans: Multimodal Fusion Image Translation via Large Language Model Priors for Downstream Visual Tasks","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-05T21:52:23.523944Z"},"links":{"cited_paper":"/paper/2503.01210","citing_paper":"/paper/2508.07803"},"observation_digest":"sha256:15f2281ee4b8f6156b6b0e944babf15e94f916333cafd9f9c22608cff23fca01","observation_id":"5fa405c6-2f88-4b12-aa1f-b3ab263b726c","resolution":{"observed_at":"2026-08-05T21:52:25.307217Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.17673","last_updated":"2025-03-22T07:01:58Z","snapshot_observed_at":"2026-08-07T16:44:29.040683Z","submitted_at":"2025-03-22T07:01:58Z","title":"DCEvo: Discriminative Cross-Dimensional Evolutionary Learning for Infrared and Visible Image Fusion","version":1},"cited_work":{"arxiv_id":"2503.17673","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.17673","snapshot_observed_at":"2026-08-05T21:52:25.108164Z","title":"DCEvo: Discriminative Cross-Dimensional Evolutionary Learning for Infrared and Visible Image Fusion","venue":"cs.CV","work_id":"36681d66-6cbc-4c2e-a56d-2fa971d451d3","year":2025},"citing_paper":{"arxiv_id":"2508.07803","last_updated":"2025-08-11T09:39:16Z","snapshot_observed_at":"2026-08-05T21:52:13.064226Z","submitted_at":"2025-08-11T09:39:16Z","title":"MambaTrans: Multimodal Fusion Image Translation via Large Language Model Priors for Downstream Visual Tasks","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-05T21:52:23.586355Z"},"links":{"cited_paper":"/paper/2503.17673","citing_paper":"/paper/2508.07803"},"observation_digest":"sha256:91d7c73f15cc1f7bde03a31374307afe5a9834355bbb68568d3d8c1e4d90449d","observation_id":"c6a96941-b04a-45d1-b68f-934966f34a9e","resolution":{"observed_at":"2026-08-05T21:52:25.159340Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:52:28.929282Z","title":"Where elegance meets precision: towards a compact, automatic, and flexible framework for multi-modality image fusion and applications","venue":null,"work_id":"60a64e8c-22f6-4ef7-a9b1-df6678d6f1c5","year":2024},"citing_paper":{"arxiv_id":"2508.07803","last_updated":"2025-08-11T09:39:16Z","snapshot_observed_at":"2026-08-05T21:52:13.064226Z","submitted_at":"2025-08-11T09:39:16Z","title":"MambaTrans: Multimodal Fusion Image Translation via Large Language Model Priors for Downstream Visual Tasks","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-05T21:52:23.647965Z"},"links":{"citing_paper":"/paper/2508.07803"},"observation_digest":"sha256:ced1def585040289220d8ba75f9f819d557cc24c9534f0d19a9b9a8f12b4336d","observation_id":"a4137315-f119-4e1f-854a-992dc18a4587","resolution":{"observed_at":"2026-08-05T21:52:29.079716Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:52:28.656544Z","title":"Equivariant multi-modality image fusion","venue":null,"work_id":"b91583ba-4b4b-4608-adaa-a0aed346b0ca","year":2024},"citing_paper":{"arxiv_id":"2508.07803","last_updated":"2025-08-11T09:39:16Z","snapshot_observed_at":"2026-08-05T21:52:13.064226Z","submitted_at":"2025-08-11T09:39:16Z","title":"MambaTrans: Multimodal Fusion Image Translation via Large Language Model Priors for Downstream Visual Tasks","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-05T21:52:23.710572Z"},"links":{"citing_paper":"/paper/2508.07803"},"observation_digest":"sha256:ae9cfe7fdcf569fe90602a54097406640d8d802b49df03d5820d71842b85bdae","observation_id":"5dc11091-632f-42ca-ac3b-9c475a758d04","resolution":{"observed_at":"2026-08-05T21:52:28.797720Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:52:28.429101Z","title":"Cddfuse: Correlation-driven dual-branch feature decomposition for multi-modality image fusion","venue":null,"work_id":"72693cfe-c5b7-45b7-9fc3-f4dbd483f319","year":2023},"citing_paper":{"arxiv_id":"2508.07803","last_updated":"2025-08-11T09:39:16Z","snapshot_observed_at":"2026-08-05T21:52:13.064226Z","submitted_at":"2025-08-11T09:39:16Z","title":"MambaTrans: Multimodal Fusion Image Translation via Large Language Model Priors for Downstream Visual Tasks","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-05T21:52:23.786134Z"},"links":{"citing_paper":"/paper/2508.07803"},"observation_digest":"sha256:045c6625e6eaa9db69606b7d1d0611c3d8673f36ff477947d1a060b6316eca25","observation_id":"255a2d7b-c502-452d-b0b0-523e20e56bb5","resolution":{"observed_at":"2026-08-05T21:52:28.529331Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:52:28.233219Z","title":"Probing synergistic high-order interaction in infrared and visible image fusion","venue":null,"work_id":"9117ca09-020d-4442-92f8-4b0a7840195c","year":2024},"citing_paper":{"arxiv_id":"2508.07803","last_updated":"2025-08-11T09:39:16Z","snapshot_observed_at":"2026-08-05T21:52:13.064226Z","submitted_at":"2025-08-11T09:39:16Z","title":"MambaTrans: Multimodal Fusion Image Translation via Large Language Model Priors for Downstream Visual Tasks","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-05T21:52:23.842113Z"},"links":{"citing_paper":"/paper/2508.07803"},"observation_digest":"sha256:d19b42ea57f7a50a6d9f6bc96517cf772f8c47be3ae125081836f0ee5d0a9ddb","observation_id":"6273535e-be8e-4d07-85b2-fb4cdc44f161","resolution":{"observed_at":"2026-08-05T21:52:28.297204Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:52:27.998507Z","title":"Coconet: Coupled contrastive learning network with multi-level feature ensemble for multi-modality image fusion","venue":null,"work_id":"b242c2a1-3fcb-4b1d-8ffc-7abd49e95579","year":2024},"citing_paper":{"arxiv_id":"2508.07803","last_updated":"2025-08-11T09:39:16Z","snapshot_observed_at":"2026-08-05T21:52:13.064226Z","submitted_at":"2025-08-11T09:39:16Z","title":"MambaTrans: Multimodal Fusion Image Translation via Large Language Model Priors for Downstream Visual Tasks","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-05T21:52:23.934211Z"},"links":{"citing_paper":"/paper/2508.07803"},"observation_digest":"sha256:4a35e3ad1b6cb31245cbc3b005215152091bf9bd241d8a6bffaf7c709f1ec855","observation_id":"b702cb31-6238-41f4-b971-534b2127bb34","resolution":{"observed_at":"2026-08-05T21:52:28.094732Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:52:27.795212Z","title":"Contrastive learning for unpaired image-to-image translation","venue":null,"work_id":"2d7937ce-22c6-421d-afd3-6a205d7ddb46","year":2020},"citing_paper":{"arxiv_id":"2508.07803","last_updated":"2025-08-11T09:39:16Z","snapshot_observed_at":"2026-08-05T21:52:13.064226Z","submitted_at":"2025-08-11T09:39:16Z","title":"MambaTrans: Multimodal Fusion Image Translation via Large Language Model Priors for Downstream Visual Tasks","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-05T21:52:23.996337Z"},"links":{"citing_paper":"/paper/2508.07803"},"observation_digest":"sha256:2d09d5207c85f33b5bffac65c0a773bd62ef160a3471451fadfa82dcd2124bed","observation_id":"572f25c5-9d32-4158-82de-22b71dfa0ef8","resolution":{"observed_at":"2026-08-05T21:52:27.905015Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:52:27.621623Z","title":"The pascal visual object classes challenge: A retrospective","venue":null,"work_id":"11e2db67-062e-425f-8a03-c572a8dfeee8","year":2015},"citing_paper":{"arxiv_id":"2508.07803","last_updated":"2025-08-11T09:39:16Z","snapshot_observed_at":"2026-08-05T21:52:13.064226Z","submitted_at":"2025-08-11T09:39:16Z","title":"MambaTrans: Multimodal Fusion Image Translation via Large Language Model Priors for Downstream Visual Tasks","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-05T21:52:24.109184Z"},"links":{"citing_paper":"/paper/2508.07803"},"observation_digest":"sha256:9663370fb39dce88e218a0c4f2345ab629d3725dd88d2bae49ef3ea9a00b217a","observation_id":"e7609665-980b-4198-b359-3000148efe3b","resolution":{"observed_at":"2026-08-05T21:52:27.731790Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:52:27.452449Z","title":"Assessment of image fusion procedures using entropy, image quality, and multispectral classification","venue":null,"work_id":"0933e4a1-f1bb-4148-9ee0-517b63bcf51e","year":2008},"citing_paper":{"arxiv_id":"2508.07803","last_updated":"2025-08-11T09:39:16Z","snapshot_observed_at":"2026-08-05T21:52:13.064226Z","submitted_at":"2025-08-11T09:39:16Z","title":"MambaTrans: Multimodal Fusion Image Translation via Large Language Model Priors for Downstream Visual Tasks","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-05T21:52:24.196100Z"},"links":{"citing_paper":"/paper/2508.07803"},"observation_digest":"sha256:5c8beb038b85821e8f76c087d8425c959613d6431a5da3c32e86a5327340966d","observation_id":"b6d9f432-c6e3-46b5-8ed4-e3975836ac9b","resolution":{"observed_at":"2026-08-05T21:52:27.510761Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:52:27.233780Z","title":"Detail preserved fusion of visible and infrared images using regional saliency extraction and multi-scale image decomposition","venue":null,"work_id":"53a4797c-b98f-43b3-8a77-8b79c05ef537","year":2015},"citing_paper":{"arxiv_id":"2508.07803","last_updated":"2025-08-11T09:39:16Z","snapshot_observed_at":"2026-08-05T21:52:13.064226Z","submitted_at":"2025-08-11T09:39:16Z","title":"MambaTrans: Multimodal Fusion Image Translation via Large Language Model Priors for Downstream Visual Tasks","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-05T21:52:24.285735Z"},"links":{"citing_paper":"/paper/2508.07803"},"observation_digest":"sha256:bbe5e87034ac0e5ff7ca925daef91b8ccc2eebd9564165387892bcc5de3c3993","observation_id":"cc129a2d-01ec-4c29-800e-51208e30d266","resolution":{"observed_at":"2026-08-05T21:52:27.340977Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:52:27.054411Z","title":"Fsim: A feature similarity index for image quality assessment","venue":null,"work_id":"0f51940a-ee4a-49c5-b0ca-696368d93cd1","year":2011},"citing_paper":{"arxiv_id":"2508.07803","last_updated":"2025-08-11T09:39:16Z","snapshot_observed_at":"2026-08-05T21:52:13.064226Z","submitted_at":"2025-08-11T09:39:16Z","title":"MambaTrans: Multimodal Fusion Image Translation via Large Language Model Priors for Downstream Visual Tasks","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-05T21:52:24.378057Z"},"links":{"citing_paper":"/paper/2508.07803"},"observation_digest":"sha256:cdce6a482f3321efc818ea1206117969c48b4dfa4ac147b9b522f986931ce89a","observation_id":"b8565c7b-b79f-498e-b190-0ad0f5caacb8","resolution":{"observed_at":"2026-08-05T21:52:27.130819Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:52:26.878391Z","title":"Image fusion metric based on mutual information and tsallis entropy","venue":null,"work_id":"2dec1b01-273f-493e-ba12-04ac20b94fcd","year":2006},"citing_paper":{"arxiv_id":"2508.07803","last_updated":"2025-08-11T09:39:16Z","snapshot_observed_at":"2026-08-05T21:52:13.064226Z","submitted_at":"2025-08-11T09:39:16Z","title":"MambaTrans: Multimodal Fusion Image Translation via Large Language Model Priors for Downstream Visual Tasks","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-05T21:52:24.458774Z"},"links":{"citing_paper":"/paper/2508.07803"},"observation_digest":"sha256:72f4a38cfb70a93249dbc314e206a359c55af57838cadd3a5a63ca896f68eb59","observation_id":"b5b73b88-d3eb-4bbd-91b5-d3110176138c","resolution":{"observed_at":"2026-08-05T21:52:26.953724Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:52:26.672283Z","title":"Image quality measures and their performance","venue":null,"work_id":"2d162eb2-042b-4acf-8efd-fbbe981aadb1","year":2002},"citing_paper":{"arxiv_id":"2508.07803","last_updated":"2025-08-11T09:39:16Z","snapshot_observed_at":"2026-08-05T21:52:13.064226Z","submitted_at":"2025-08-11T09:39:16Z","title":"MambaTrans: Multimodal Fusion Image Translation via Large Language Model Priors for Downstream Visual Tasks","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-05T21:52:24.550186Z"},"links":{"citing_paper":"/paper/2508.07803"},"observation_digest":"sha256:92f9edf1d3f3b4471690e62e41a11a285c422694eea01f63e503a48a8ddeffee","observation_id":"b1156e03-b3a0-4d7c-a857-8c796da41b4c","resolution":{"observed_at":"2026-08-05T21:52:26.804297Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:52:26.531790Z","title":"Contrastive learning for unpaired image-to-image translation","venue":null,"work_id":"44ad4585-3290-4220-8ef5-db72da315d28","year":2020},"citing_paper":{"arxiv_id":"2508.07803","last_updated":"2025-08-11T09:39:16Z","snapshot_observed_at":"2026-08-05T21:52:13.064226Z","submitted_at":"2025-08-11T09:39:16Z","title":"MambaTrans: Multimodal Fusion Image Translation via Large Language Model Priors for Downstream Visual Tasks","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-05T21:52:24.609982Z"},"links":{"citing_paper":"/paper/2508.07803"},"observation_digest":"sha256:814f3ff18e0ecb8aeb7a14fc68c4069b7d4bb4c571b832116086cd5c75f52377","observation_id":"5595f56a-d325-46f5-a2cc-d8ba3b43b6f7","resolution":{"observed_at":"2026-08-05T21:52:26.584059Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:52:26.363425Z","title":"Doubao vision pro 32k","venue":null,"work_id":"8b61274b-a46a-4dd6-9300-1045a8aae44a","year":null},"citing_paper":{"arxiv_id":"2508.07803","last_updated":"2025-08-11T09:39:16Z","snapshot_observed_at":"2026-08-05T21:52:13.064226Z","submitted_at":"2025-08-11T09:39:16Z","title":"MambaTrans: Multimodal Fusion Image Translation via Large Language Model Priors for Downstream Visual Tasks","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-05T21:52:24.695539Z"},"links":{"citing_paper":"/paper/2508.07803"},"observation_digest":"sha256:41299487886883b2f8215cf9fd97b915d991fd8dd8206809dcb271a915192dda","observation_id":"7d03129e-0337-429b-a8e3-b68856ba74bb","resolution":{"observed_at":"2026-08-05T21:52:26.427719Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:52:26.173057Z","title":"Fastinst: A simple query-based model for real-time instance segmentation","venue":null,"work_id":"bd986224-b615-4bc3-b691-8c0dd2050262","year":2023},"citing_paper":{"arxiv_id":"2508.07803","last_updated":"2025-08-11T09:39:16Z","snapshot_observed_at":"2026-08-05T21:52:13.064226Z","submitted_at":"2025-08-11T09:39:16Z","title":"MambaTrans: Multimodal Fusion Image Translation via Large Language Model Priors for Downstream Visual Tasks","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-05T21:52:24.779892Z"},"links":{"citing_paper":"/paper/2508.07803"},"observation_digest":"sha256:2c12c904b40b2da2161316821aba20780a07ca33d09984a876bd310e7e704a5c","observation_id":"0a875a7b-ce21-4c50-a7c2-56eff4607016","resolution":{"observed_at":"2026-08-05T21:52:26.250516Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:52:26.008039Z","title":"Cascade r-cnn: Delving into high quality object detection","venue":null,"work_id":"57a52e03-9334-4127-afe4-021482e199b9","year":2018},"citing_paper":{"arxiv_id":"2508.07803","last_updated":"2025-08-11T09:39:16Z","snapshot_observed_at":"2026-08-05T21:52:13.064226Z","submitted_at":"2025-08-11T09:39:16Z","title":"MambaTrans: Multimodal Fusion Image Translation via Large Language Model Priors for Downstream Visual Tasks","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-05T21:52:24.838186Z"},"links":{"citing_paper":"/paper/2508.07803"},"observation_digest":"sha256:93321c69c0a3f779aae1d587ebc37ad561fc32684244c2d61b44f189f3833fcb","observation_id":"85e2643c-66e2-4d01-9075-53beed274f0e","resolution":{"observed_at":"2026-08-05T21:52:26.089616Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:52:25.849449Z","title":"Mask dino: Towards a unified transformer-based framework for object detection and segmentation","venue":null,"work_id":"2dcbe69c-7c36-4c08-be25-928ea1570d4b","year":2023},"citing_paper":{"arxiv_id":"2508.07803","last_updated":"2025-08-11T09:39:16Z","snapshot_observed_at":"2026-08-05T21:52:13.064226Z","submitted_at":"2025-08-11T09:39:16Z","title":"MambaTrans: Multimodal Fusion Image Translation via Large Language Model Priors for Downstream Visual Tasks","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-05T21:52:24.927151Z"},"links":{"citing_paper":"/paper/2508.07803"},"observation_digest":"sha256:0b2419b6e659a53e5dd143aebdc75b0dc20a40ea194cf5eaeb7ecfda72965f39","observation_id":"e28765f1-bead-406f-80c3-2e89ef03ec38","resolution":{"observed_at":"2026-08-05T21:52:25.921270Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17725","last_updated":"2024-10-23T09:55:22Z","snapshot_observed_at":"2026-07-06T19:38:22.461739Z","submitted_at":"2024-10-23T09:55:22Z","title":"YOLOv11: An Overview of the Key Architectural Enhancements","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.17725","snapshot_observed_at":"2026-08-05T21:52:25.017468Z","title":"Yolov11: An overview of the key architectural enhancements","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.07803","last_updated":"2025-08-11T09:39:16Z","snapshot_observed_at":"2026-08-05T21:52:13.064226Z","submitted_at":"2025-08-11T09:39:16Z","title":"MambaTrans: Multimodal Fusion Image Translation via Large Language Model Priors for Downstream Visual Tasks","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-05T21:52:25.017468Z"},"links":{"cited_paper":"/paper/2410.17725","citing_paper":"/paper/2508.07803"},"observation_digest":"sha256:a83e1b20bff271c2bc75b193b9e666b5fc435c645ed86032121045c8ecff737b","observation_id":"694e4564-e847-47f0-a216-ccae6b2ecc79","resolution":{"observed_at":"2026-08-05T21:52:25.017468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2508.07803","last_updated":"2025-08-11T09:39:16Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-05T21:52:13.064226Z","submitted_at":"2025-08-11T09:39:16Z","title":"MambaTrans: Multimodal Fusion Image Translation via Large Language Model Priors for Downstream Visual Tasks"},"reference_resolution":{"displayed":47,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":7,"verified_exact":2,"verified_fuzzy":38},"total_outbound_references":47},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 47 of 47 outbound references and 1 inbound Pith citation observation for arXiv:2508.07803."}