{"as_of":"2026-08-15T15:22:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ac5488980cdc2e256c01eead4741cf5ca804ab67347e09e29301c45425b51295","coverage":[{"denominator":83,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":83,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T15:18:29.140260Z","state":"measured"},{"denominator":83,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":83,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.16318/citation-record","integrity":"/paper/2507.16318/integrity","json":"/paper/2507.16318/citation-record.json","paper":"/paper/2507.16318"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:18.184990Z","title":"Effectiveness guided cross-modal information sharing for aligned rgb-t object de- tection","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:18.184990Z"},"links":{"citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:6e9a30248865f7d09bc194c23b87aa6336332d98001ad38c6d40285c462ae84b","observation_id":"d9b9061a-8e35-4dd8-a0e7-a2880e2ba89e","resolution":{"observed_at":"2026-08-06T15:18:18.184990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.13721","last_updated":"2023-07-25T17:59:18Z","snapshot_observed_at":"2026-08-15T02:11:20.975556Z","submitted_at":"2023-07-25T17:59:18Z","title":"Foundational Models Defining a New Era in Vision: A Survey and Outlook","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.13721","snapshot_observed_at":"2026-08-06T15:18:18.279229Z","title":"Foundational models defining a new era in vision: A survey and outlook","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:18.279229Z"},"links":{"cited_paper":"/paper/2307.13721","citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:f7c89e96ec005315768a0d8d66f9175b3f8046f4fed12d341b1c61af5a5a97ab","observation_id":"7717a507-3fb4-40c5-a3e1-20bf9bca7fa4","resolution":{"observed_at":"2026-08-06T15:18:18.279229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:18.410690Z","title":"Multimodal object detection by channel switching and spatial attention","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:18.410690Z"},"links":{"citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:f3812b78a5769819a20320700c020a910f2768cc2e95d4e4c4a3261d15b51537","observation_id":"2ec73e11-a5bc-4b08-80b3-6fe007d9c075","resolution":{"observed_at":"2026-08-06T15:18:18.410690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:18.505207Z","title":"Encoder-decoder with atrous separable convolution for semantic image segmentation","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:18.505207Z"},"links":{"citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:2fc0aca0952355f52822a4d019336cf338756296c036952a53def82f2518abe3","observation_id":"42cef2d4-d42c-4f30-8859-2e580c1e5d90","resolution":{"observed_at":"2026-08-06T15:18:18.505207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:47.193327Z","title":"Multimodal object detection via probabilistic ensembling","venue":null,"work_id":"6878997a-5c24-45f0-8169-f201a6b0cce8","year":2022},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:18.572100Z"},"links":{"citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:5359e7388111b54edf662854d60b0ee21d316326d01cce1ba0aabbe5ce42bc56","observation_id":"915e9008-126a-43ac-916e-372473d97a64","resolution":{"observed_at":"2026-08-06T15:18:47.329749Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:46.981682Z","title":"Feanet: Feature-enhanced atten- tion network for rgb-thermal real-time semantic segmenta- tion","venue":null,"work_id":"92c7ce3a-1700-4f29-be87-852b03233981","year":2021},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:18.702177Z"},"links":{"citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:9544eb64d2bccfd8c95cbe2f1450c232ab4f2f64a5e83176a4554ec12a2d1d1b","observation_id":"2fd196b7-715e-4461-9b78-751556277706","resolution":{"observed_at":"2026-08-06T15:18:47.093486Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:46.814619Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":"9606045a-6b88-432c-b6b5-26d085209bd2","year":2009},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:18.849628Z"},"links":{"citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:fbee4def0f148d82c85772ab941c71c0cb90b1e09ddde08251ae3284ffcdd59c","observation_id":"62c236d1-1b71-4643-a9bb-66d887b11671","resolution":{"observed_at":"2026-08-06T15:18:46.900367Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:46.632366Z","title":"Redfeat: Recoupling detection and description for multimodal feature learning.IEEE Trans- actions on Image Processing, 32:591–602, 2022","venue":null,"work_id":"f392dee0-47d0-4f2d-a383-51b4cad4217c","year":2022},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:18.960595Z"},"links":{"citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:63ab39572d9706dc553ea3198d2924b56e198c6c03d6ca15ecbec74e23fa840e","observation_id":"8e675778-c0fc-4c0b-9406-efc5896e4907","resolution":{"observed_at":"2026-08-06T15:18:46.724609Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00360","last_updated":"2023-12-04T04:38:17Z","snapshot_observed_at":"2026-08-14T07:04:46.646405Z","submitted_at":"2023-12-01T05:50:44Z","title":"Efficient Multimodal Semantic Segmentation via Dual-Prompt Learning","version":2},"cited_work":{"arxiv_id":"2312.00360","doi":null,"metadata_source":"pith","pith_arxiv_id":"2312.00360","snapshot_observed_at":"2026-08-06T15:18:30.014864Z","title":"Efficient Multimodal Semantic Segmentation via Dual-Prompt Learning","venue":"cs.CV","work_id":"eb1ab6ce-e099-4b28-8cb9-d493e247c76e","year":2023},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:19.060825Z"},"links":{"cited_paper":"/paper/2312.00360","citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:117d10375b8595c4eb6fb778d371f2d37e08a6ddb4ca35b5dbc8df4aeba13f5f","observation_id":"30295ddd-2af1-4985-a9fc-73c1f12c7b43","resolution":{"observed_at":"2026-08-06T15:18:30.100016Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-13T14:19:26.598265Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-06T15:18:19.170342Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:19.170342Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:ff08eabdc658263e331dcf10f5944868a44a20bcf0311d4ca32b448a2f589c36","observation_id":"025d29a9-4691-4538-b17f-f432690ac330","resolution":{"observed_at":"2026-08-06T15:18:19.170342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:46.467483Z","title":"Siamese network for rgb-d salient object detection and beyond","venue":null,"work_id":"18881f2d-3adf-4d27-9816-0487fae92c3e","year":2021},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:19.290356Z"},"links":{"citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:e04f6575c8a8378af3a5415f48e93d8eb28c4006e6a0843f1a19a926f72fac73","observation_id":"03e9db4b-97be-4cbc-815f-a867b13970b1","resolution":{"observed_at":"2026-08-06T15:18:46.542537Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:46.326106Z","title":"Fusion of multispectral data through illumination-aware deep neural networks for pedestrian de- tection","venue":null,"work_id":"ef0a475e-daf0-4477-a150-d5a36e48050e","year":2019},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:19.391466Z"},"links":{"citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:ff445e65057bb728737be2db0e4ea23fba88bc01bf120269c15d07908eb8a2ac","observation_id":"109bb509-30fc-4aee-a1fa-8b052dcf2c68","resolution":{"observed_at":"2026-08-06T15:18:46.395814Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:46.176449Z","title":"Mfnet: Towards real-time se- mantic segmentation for autonomous vehicles with multi- spectral scenes","venue":null,"work_id":"e9189862-c8bb-497a-9548-8fa59567758f","year":2017},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:19.533671Z"},"links":{"citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:f750b3fb349ef34d785b01b392644bc621d0ad20fd7cb9792764fae60fee2519","observation_id":"17a801b4-a45f-42b1-9907-56facb25b838","resolution":{"observed_at":"2026-08-06T15:18:46.252155Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:45.992344Z","title":"Masked autoencoders are scalable vision learners","venue":null,"work_id":"474a3960-c7eb-44d5-bb67-10063340e04d","year":2022},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:19.633092Z"},"links":{"citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:e2685656029cf49270173e2f9d055e3d799089203c9200007a43c537a9e71371","observation_id":"bbe3bad4-047d-430b-9f47-e6f8f1986a70","resolution":{"observed_at":"2026-08-06T15:18:46.062913Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:45.809893Z","title":"Multispec- tral object detection via cross-modal conflict-aware learning","venue":null,"work_id":"cccf24fa-f3cd-430e-8726-ea217634e163","year":2023},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:19.775701Z"},"links":{"citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:d4fe6f177facdad1525b1b307e48bda6b580cf30e9ed9ed606f89d68eb11ad21","observation_id":"10fbabd0-9e40-499b-9510-59755331f869","resolution":{"observed_at":"2026-08-06T15:18:45.915744Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:45.553788Z","title":"Spectralgpt: Spectral remote sensing foun- dation model","venue":null,"work_id":"d67663bc-7a95-4e76-93a7-16962de44b18","year":2024},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:19.895866Z"},"links":{"citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:c21da3f6197c3951370cb922edbe3492d9ffb97b04789f9513264f7804bccba7","observation_id":"0203e63c-d16e-4043-8900-799f191a4737","resolution":{"observed_at":"2026-08-06T15:18:45.674958Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.06049","last_updated":"2022-12-19T19:21:47Z","snapshot_observed_at":"2026-08-13T14:46:55.775257Z","submitted_at":"2022-08-11T21:58:36Z","title":"MILAN: Masked Image Pretraining on Language Assisted Representation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.06049","snapshot_observed_at":"2026-08-06T15:18:20.058704Z","title":"Milan: Masked image pretraining on language assisted representation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:20.058704Z"},"links":{"cited_paper":"/paper/2208.06049","citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:5faae54dce633d9596a881d07f3f2cafdf6d75c6f549015bee3683d61ad70a41","observation_id":"df4b34dc-c368-40e4-a888-9abc382f43b2","resolution":{"observed_at":"2026-08-06T15:18:20.058704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:45.389579Z","title":"Pos-gift: A geomet- ric and intensity-invariant feature transformation for multi- modal images","venue":null,"work_id":"c485fbe6-7d6d-4cb1-922c-46ee350dd171","year":2024},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:20.163393Z"},"links":{"citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:848649099a41e0e30fe3f77202d05f7c321e778fb3e44f1000f88a960ed5ceb0","observation_id":"f1a167fb-9b71-4cf6-8e8b-2b2a90d831ea","resolution":{"observed_at":"2026-08-06T15:18:45.463015Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:45.256825Z","title":"Multi-graph fusion and learning for rgbt im- age saliency detection","venue":null,"work_id":"dfe8726c-f24a-408b-9182-34f13807cceb","year":2021},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:20.232566Z"},"links":{"citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:dbfaf7b7c3d352d1ffb1f59511b8be5c5990001e6d519826734d421c749a5946","observation_id":"5a43f7f9-9a80-4934-8b3f-c736c28887f3","resolution":{"observed_at":"2026-08-06T15:18:45.299389Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:45.131154Z","title":"Multispectral pedestrian detection: Benchmark dataset and baseline","venue":null,"work_id":"22ee4ae3-96b9-4137-828e-09b25c52c8c7","year":2015},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:20.582198Z"},"links":{"citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:d3cea87e2475a9f449c96924c5ad6c15db393fdc5fef7256bcf4421c03b234a2","observation_id":"f95a5d37-da2a-4085-9028-8841ad56268a","resolution":{"observed_at":"2026-08-06T15:18:45.211931Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:44.871378Z","title":"Multispectral pedestrian detection: Benchmark dataset and baseline","venue":null,"work_id":"4ced8b5c-97f6-42ab-9d69-bd5036fc99db","year":2015},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:21.309500Z"},"links":{"citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:e29852a49dd40b785161190517aed815694099e35238be79960c6e335e74962e","observation_id":"3e1274d6-9df0-462f-958f-a4ef46a3a77a","resolution":{"observed_at":"2026-08-06T15:18:45.010825Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:44.561692Z","title":"Semanticrt: A large-scale dataset and method for robust semantic segmentation in multispectral images","venue":null,"work_id":"0fdfd366-476a-4eef-9301-8dd03b924a84","year":2023},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:21.410685Z"},"links":{"citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:12696d2942045fc059c4d52f3da62baf73f17e97c2991de3ddf144dc64e5d6ff","observation_id":"44c4dcd6-ea3c-4076-9662-45203f5ddaf9","resolution":{"observed_at":"2026-08-06T15:18:44.691650Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:44.330752Z","title":"Multispectral video se- mantic segmentation: A benchmark dataset and baseline","venue":null,"work_id":"cb30dbcf-2785-4e60-877b-bc06d1203168","year":2023},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:21.529022Z"},"links":{"citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:7a5f495dab1d455e6a610172bbc4f5c85db12926fc7317cb0ed4099da3e90458","observation_id":"1c66585d-2008-42fc-9fc9-ec27c118435a","resolution":{"observed_at":"2026-08-06T15:18:44.460776Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:44.141821Z","title":"Llvip: A visible-infrared paired dataset for low-light vision","venue":null,"work_id":"6877b779-2d7e-4500-9236-08684f2f21c0","year":2021},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:21.666409Z"},"links":{"citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:3faeeec726ee09b6f6cead686654bd2814ea0d41230defc2f36c8fa5fb8728b4","observation_id":"d4a52f16-9b95-4f7d-97b0-77a412fd5b40","resolution":{"observed_at":"2026-08-06T15:18:44.235725Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:21.781386Z","title":"What to hide from your students: Attention-guided masked image modeling","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:21.781386Z"},"links":{"citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:3570299aee2dad89889b606fe7c683f057530e86a6a453e7633e84ed2213658b","observation_id":"5f30e859-c301-441d-b686-249456ff3293","resolution":{"observed_at":"2026-08-06T15:18:21.781386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:43.859663Z","title":"Crossformer: Cross-guided attention for multi-modal object detection.Pat- tern Recognition Letters, 179:144–150, 2024","venue":null,"work_id":"5465f169-8076-4413-966e-3ff6cc02b0fe","year":2024},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:21.906719Z"},"links":{"citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:e0e58be74a479a58ec2f88865fae460995471ac42c3001830db5f58c88f1132a","observation_id":"67ac5a57-49c5-42ed-9968-3fd10733ecb2","resolution":{"observed_at":"2026-08-06T15:18:43.993881Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1808.04818","last_updated":"2018-08-14T17:59:12Z","snapshot_observed_at":"2026-08-14T18:41:11.317186Z","submitted_at":"2018-08-14T17:59:12Z","title":"Multispectral Pedestrian Detection via Simultaneous Detection and Segmentation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1808.04818","snapshot_observed_at":"2026-08-06T15:18:22.045311Z","title":"Multispectral Pedestrian Detection via Simulta- neous Detection and Segmentation","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:22.045311Z"},"links":{"cited_paper":"/paper/1808.04818","citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:189e300cd9127e95e2c0697a42beb6bf1e317d27ed2d74f98de6a370ea9fd904","observation_id":"3ac60b8e-4d10-4886-89dc-1a72608aafb1","resolution":{"observed_at":"2026-08-06T15:18:22.045311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:43.632652Z","title":"Lasher: A large-scale high- diversity benchmark for rgbt tracking.IEEE Transactions on Image Processing, 31:392–404, 2021","venue":null,"work_id":"bdc6d450-8da0-4886-98c7-7210c3f3f88b","year":2021},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:22.212992Z"},"links":{"citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:8f16aeb91ed816eea1c38e952cda2d19c4700a6d0bb47e1ab8e09a93817684cb","observation_id":"5527eecf-5f18-4e7d-9635-927bd07f9bb0","resolution":{"observed_at":"2026-08-06T15:18:43.762151Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:43.418826Z","title":"Semmae: Semantic-guided mask- ing for learning masked autoencoders","venue":null,"work_id":"f0eeaada-8a7d-4ab1-8815-c1d905c7836b","year":2022},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:22.432390Z"},"links":{"citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:977c925fcfcd39ca6dcfce11e3d51c5ff5d80771132d1e8c68de5de4310ae020","observation_id":"fff28392-3014-48f4-84b1-fd0ba553e912","resolution":{"observed_at":"2026-08-06T15:18:43.514827Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:43.203549Z","title":"Rift: Multi-modal image matching based on radiation-variation insensitive fea- ture transform","venue":null,"work_id":"989409bf-aa08-4db4-96fd-6073a46331a0","year":2019},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:22.592268Z"},"links":{"citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:6a682594ced3e94dbbf6eb769a9b835398be3e9c2f7656dde690214a93bc07a4","observation_id":"e05d2c8a-4709-47bb-8b2c-b79f38793ad7","resolution":{"observed_at":"2026-08-06T15:18:43.317055Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:42.925885Z","title":"Confidence-aware fusion using dempster- shafer theory for multispectral pedestrian detection","venue":null,"work_id":"ccff5ab7-f6b0-4486-a9d0-08ac1c3fff6c","year":2022},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:22.732821Z"},"links":{"citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:dda392e5e545d9047857567ad7f81caa4b7c7f2ee1c8a0d7d17fe4294ed90168","observation_id":"bd1b5fe3-f834-4c3b-9f21-5b931d74722e","resolution":{"observed_at":"2026-08-06T15:18:43.071769Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:42.691238Z","title":"Saratr-x: Toward building a foundation model for sar target recognition","venue":null,"work_id":"9bb86964-b0c6-4d9e-b188-e9b87904b789","year":2025},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:22.919691Z"},"links":{"citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:a3a407ba9f19e29ac6f6ad5dd5e30078e6869fdb57bfc74d06c2708674bb2ddb","observation_id":"563676bb-3965-4bfc-803d-cd93c7df7745","resolution":{"observed_at":"2026-08-06T15:18:42.789636Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:42.496657Z","title":"Generalized focal loss: Learning qualified and distributed bounding boxes for dense object detection","venue":null,"work_id":"e664d4a0-dfb7-4867-8040-8ac6481c258b","year":2020},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:23.132441Z"},"links":{"citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:e5bf1b5de3dfa6738218a9a3436fb248a42616e11deffa355a2b25c0b86cd81d","observation_id":"edcd953c-adcd-4ab7-b70c-1b5db1429871","resolution":{"observed_at":"2026-08-06T15:18:42.585309Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:42.295140Z","title":"Exploring plain vision transformer backbones for object de- tection","venue":null,"work_id":"825feb03-7a5f-43c7-aa23-e1075d8f45f7","year":2022},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:23.246815Z"},"links":{"citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:63b6cd94e3b4920c9f5c12c07981896a445c5d78eaae5db0f1d6493fd674fe2b","observation_id":"c50aa9ce-3ee6-442c-b0f8-e4a251e5b94d","resolution":{"observed_at":"2026-08-06T15:18:42.395617Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:42.050888Z","title":"Lightglue: Local feature matching at light speed","venue":null,"work_id":"33126ea5-9666-4acb-aa23-fe1ec8beac5d","year":2023},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:23.356455Z"},"links":{"citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:e204510d27d35933a16c7842d328f081729f80b4591860b5e1a957e1f45d4363","observation_id":"0042fdba-0869-4dd0-8df5-8fe047c1bd76","resolution":{"observed_at":"2026-08-06T15:18:42.174865Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:41.794579Z","title":"Infmae: A foundation model in the infrared modality","venue":null,"work_id":"8616b891-bc20-405e-b1de-f7c6224c0230","year":2025},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:23.478882Z"},"links":{"citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:17e098ef38d42f9d6ba439586106dae7a1b5222bc48b529dfe5640d474f65e04","observation_id":"c484f5b8-07bb-48c6-bd19-fa53a0901cdb","resolution":{"observed_at":"2026-08-06T15:18:41.895390Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1611.02644","last_updated":"2016-11-08T18:22:31Z","snapshot_observed_at":"2026-08-14T21:31:22.163268Z","submitted_at":"2016-11-08T18:22:31Z","title":"Multispectral Deep Neural Networks for Pedestrian Detection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1611.02644","snapshot_observed_at":"2026-08-06T15:18:23.608139Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:23.608139Z"},"links":{"cited_paper":"/paper/1611.02644","citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:554308a34ad846b19742befefd6e0d746aad6dc61214e9b93239ef89f2dcc636","observation_id":"36e7c057-4f64-4e7c-a860-f50fa0404027","resolution":{"observed_at":"2026-08-06T15:18:23.608139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:41.564767Z","title":"Multi- interactive feature learning and a full-time multi-modality benchmark for image fusion and segmentation","venue":null,"work_id":"3d1869f6-b773-4f29-baa6-31537864757a","year":2023},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:23.717102Z"},"links":{"citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:f433c910013143d9cfcb11acaad645bf35e64e9f1e2325401ef674d013ba310e","observation_id":"9c0ef9fe-54dd-4b62-bfe6-aec2699223e1","resolution":{"observed_at":"2026-08-06T15:18:41.673417Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:41.336277Z","title":"Learning selective self-mutual attention for rgb-d saliency detection","venue":null,"work_id":"4281a5db-9361-40f3-ad18-86a340f28b67","year":2020},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:23.848618Z"},"links":{"citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:9519698ff622ae906da211412b365edd2b9627a52bab1a8308884b37ad5e6cdc","observation_id":"972a2357-ebac-4d18-81ad-d9e012dabff3","resolution":{"observed_at":"2026-08-06T15:18:41.426726Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:41.054975Z","title":"Local memory attention for fast video semantic segmentation","venue":null,"work_id":"f7a3bf1f-ddcb-4b48-babc-5c241569a7e4","year":2021},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:24.011554Z"},"links":{"citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:debc80a0359af7cc284bf99726d6792c92bbeaf7974ecec4953805bda464c6a6","observation_id":"30504827-507e-4a7a-8508-0841cd5a7a3c","resolution":{"observed_at":"2026-08-06T15:18:41.177473Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.00273","last_updated":"2022-10-04T09:52:39Z","snapshot_observed_at":"2026-07-06T12:03:45.415112Z","submitted_at":"2021-10-30T15:34:12Z","title":"Cross-Modality Fusion Transformer for Multispectral Object Detection","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.00273","snapshot_observed_at":"2026-08-06T15:18:24.156472Z","title":"Cross- modality fusion transformer for multispectral object detec- tion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:24.156472Z"},"links":{"cited_paper":"/paper/2111.00273","citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:36d173c7add8503dfbcd82fdff348ede5312aaba0cb1140a68d6870173344fb8","observation_id":"a5d55659-dcd5-4852-bd93-63da4a9ddcbb","resolution":{"observed_at":"2026-08-06T15:18:24.156472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:40.775555Z","title":"Icafusion: Iterative cross-attention guided feature fusion for multispectral object detection","venue":null,"work_id":"71fd2f0e-4252-4695-a662-6706b3102b6a","year":2024},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:24.255143Z"},"links":{"citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:7d080537d6812a753ae9f3a959151bd9845594f393ee9db8447b317c097d8709","observation_id":"8d6e959a-60eb-4823-912f-0e117f12e489","resolution":{"observed_at":"2026-08-06T15:18:40.930122Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:40.470526Z","title":"Pst900: Rgb- thermal calibration, dataset and segmentation network","venue":null,"work_id":"e9ccf68e-03a8-400c-ac1f-7aae4bcb06ca","year":2020},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:24.353550Z"},"links":{"citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:0a7114128413a363b700c97b4570b53a93e1ff94edf1646a844441eb86404920","observation_id":"d582a157-e34e-49b4-9e39-745415916cf7","resolution":{"observed_at":"2026-08-06T15:18:40.655928Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:40.227452Z","title":"Multiple graph affinity interactive network and a variable il- lumination dataset for rgbt image salient object detection","venue":null,"work_id":"dfd8780d-5834-4856-82c2-f4402650c07d","year":2022},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:24.432926Z"},"links":{"citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:9b2fc152f314f5d01d91cfe5a497e9662132f233a5344c52055cd3554837dfb7","observation_id":"a3716968-bce4-4e4f-8e72-92fac309ea3c","resolution":{"observed_at":"2026-08-06T15:18:40.351365Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:40.011468Z","title":"Loftr: Detector-free local feature matching with transformers","venue":null,"work_id":"9e41e264-7ec7-42bb-8b4a-529a7c46f4f2","year":2021},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:24.535469Z"},"links":{"citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:f12aaf57ccb0c247a0711ccd1532dc16dc05214a60f61bff7d827c3746c4e208","observation_id":"776100b1-d643-45d7-a2b4-f37807387d8d","resolution":{"observed_at":"2026-08-06T15:18:40.130789Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:39.778082Z","title":"Rtfnet: Rgb- thermal fusion network for semantic segmentation of urban scenes","venue":null,"work_id":"d17c3115-0867-48f3-91b6-b3cdcebee185","year":2019},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:24.604516Z"},"links":{"citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:d35d696b243ee7e4df579099ea49e6ffc485306df7656e85cbb9ebb26a7e60a2","observation_id":"32fce89f-08d6-41dc-94f4-0675c2edd515","resolution":{"observed_at":"2026-08-06T15:18:39.905351Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:39.556160Z","title":"Rgb-t image saliency detection via collaborative graph learning","venue":null,"work_id":"bce2c435-51cf-40a1-8159-a0ff9dd28898","year":2019},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:24.740161Z"},"links":{"citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:e0ddbd582483f8e849c0e2eff17d1ed9fcc9abdad768b6794b3aa89f8b5ef814","observation_id":"6fc6d81c-ad99-4029-9200-7c326f2fd918","resolution":{"observed_at":"2026-08-06T15:18:39.675386Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:39.269592Z","title":"Multi-interactive encoder-decoder network for rgbt salient object detection","venue":null,"work_id":"070de9aa-15a0-45fe-a300-be8b2cb38944","year":2005},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:24.852425Z"},"links":{"citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:58c652deea9b32f363012acf927ad68637d9765899b0fb48228f06bebeab4107","observation_id":"d630c9da-6def-423e-9bc9-a49c7524eec9","resolution":{"observed_at":"2026-08-06T15:18:39.381149Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:39.019680Z","title":"Multi-interactive dual-decoder for rgb-thermal salient object detection","venue":null,"work_id":"cf4b7e45-ae61-458c-91e3-8a119a1b6132","year":2021},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:24.978333Z"},"links":{"citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:0a262240dc73b2c35dafaab647f3207959f51632b475b320a57bc29a68d26bd2","observation_id":"30e3c5c7-992c-4cc5-a8d4-be8b5031ff76","resolution":{"observed_at":"2026-08-06T15:18:39.121305Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:38.749380Z","title":"Rgbt salient object detection: A large- scale dataset and benchmark","venue":null,"work_id":"2ca945a8-7e8a-4229-b031-7ea7a0404d9a","year":2022},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:25.121344Z"},"links":{"citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:011c87eea131e6fa255d54d349e6e91891d6e5cd412b02e92da9de1517998b56","observation_id":"8bbca9b8-ee32-4517-baa1-4cfb2090089e","resolution":{"observed_at":"2026-08-06T15:18:38.875618Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11519","last_updated":"2025-04-01T15:14:22Z","snapshot_observed_at":"2026-08-12T23:41:06.809659Z","submitted_at":"2024-06-17T13:22:58Z","title":"HyperSIGMA: Hyperspectral Intelligence Comprehension Foundation Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11519","snapshot_observed_at":"2026-08-06T15:18:25.256613Z","title":"Hypersigma: Hyperspectral intelligence comprehen- sion foundation model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:25.256613Z"},"links":{"cited_paper":"/paper/2406.11519","citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:630cd8a9f41c660099204985a779bbffc59d65fc9d96c4b9377ad30f0ead1a57","observation_id":"5dc56d59-87ee-4aaf-ab42-ccc56ebdaa86","resolution":{"observed_at":"2026-08-06T15:18:25.256613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:38.497356Z","title":"Rgb-t saliency detection benchmark: Dataset, baselines, analysis and a novel approach","venue":null,"work_id":"9fc4dbda-295e-45a8-b4b2-1ee379b5344f","year":2018},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:25.361056Z"},"links":{"citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:67491fd271b96c07b1e995447ce5813e166d67f62c938300cdc0e315ae890bcb","observation_id":"f09950fe-abe2-450f-a846-8bbd5640dbed","resolution":{"observed_at":"2026-08-06T15:18:38.632384Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:38.261168Z","title":"Hard patches mining for masked image modeling","venue":null,"work_id":"970f1436-c0a1-4dd0-b9f9-cefaa4ab4ffb","year":2023},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:25.472691Z"},"links":{"citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:bd3f508c9ec6ad8d8b6f2b852752e68c99e2be7fa8f7d5d9867f52503c341df5","observation_id":"024a49df-aa54-4800-a2f0-333b8870a7b0","resolution":{"observed_at":"2026-08-06T15:18:38.378331Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:38.015804Z","title":"Cgfnet: Cross-guided fusion network for rgb-t salient object detection","venue":null,"work_id":"8aee84bc-d0cb-4551-b4ed-116bb42d702f","year":2022},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:25.575977Z"},"links":{"citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:ff68ce686a2035dbfd3ecda1c9b61171504d1572fd884979fb4d96bb770f6e0a","observation_id":"7603ebba-8587-4178-8ce1-524f341f7502","resolution":{"observed_at":"2026-08-06T15:18:38.105423Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:37.715226Z","title":"Sgfnet: semantic- guided fusion network for rgb-thermal semantic segmenta- tion","venue":null,"work_id":"0446b6af-475e-4b4b-b5ad-a6233cbf165f","year":2023},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:25.704948Z"},"links":{"citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:14f4ee0baf036f755bb8ff7700744787e76617bbc7e4bbebe0bbb8e7438d1519","observation_id":"a28973bb-fe66-46eb-a802-489d1fc0e1b5","resolution":{"observed_at":"2026-08-06T15:18:37.892776Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:37.569590Z","title":"Image quality assessment: from error visibility to structural similarity","venue":null,"work_id":"bb78ee1d-2633-4630-9bf9-1813b417f83d","year":2004},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:25.840867Z"},"links":{"citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:2983c3f35305c135024d60f4e684aa78fb1d22b0b5c7d3edb87cd8de8000bb76","observation_id":"a24eeddd-b2de-4b8b-b410-7103df39f119","resolution":{"observed_at":"2026-08-06T15:18:37.664248Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:37.428482Z","title":"Tirdet: Mono-modality thermal infrared object detection based on prior thermal-to-visible translation","venue":null,"work_id":"2f67f6d6-aabe-4d36-8b8c-0280ad02ef91","year":2023},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:26.016052Z"},"links":{"citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:0ea027d88ebf7c6c0040427b8ae7ea0907bdaa28655f22a90766f3c842521707","observation_id":"74c62848-1178-469d-aa86-4d5e55365856","resolution":{"observed_at":"2026-08-06T15:18:37.511343Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.14338","last_updated":"2022-05-28T05:13:45Z","snapshot_observed_at":"2026-08-13T15:34:57.595959Z","submitted_at":"2022-05-28T05:13:45Z","title":"Object-wise Masked Autoencoders for Fast Pre-training","version":1},"cited_work":{"arxiv_id":"2205.14338","doi":null,"metadata_source":"pith","pith_arxiv_id":"2205.14338","snapshot_observed_at":"2026-08-06T15:18:29.810919Z","title":"Object-wise Masked Autoencoders for Fast Pre-training","venue":"cs.CV","work_id":"feab7c0c-297f-4f80-bf61-409c1d310204","year":2022},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:26.176581Z"},"links":{"cited_paper":"/paper/2205.14338","citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:434a977cd4e9529dc04a47fe1a5096d31dee82cf74915e11f93a73ffd88b361e","observation_id":"15c2c8d7-3e35-4e04-924a-2f33a8fa8882","resolution":{"observed_at":"2026-08-06T15:18:29.861145Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:37.202101Z","title":"Unified perceptual parsing for scene understand- ing","venue":null,"work_id":"e349c55d-fe7e-468c-b8a5-d30f62399c71","year":2018},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:26.304589Z"},"links":{"citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:1cd0baa04b6eb7f17afa9769b98de66a85246cf3dd8d05099e40717d6231c553","observation_id":"4a368247-c597-4ba8-b320-6bf730b51a53","resolution":{"observed_at":"2026-08-06T15:18:37.301348Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:37.055901Z","title":"Early convolutions help trans- formers see better","venue":null,"work_id":"751c2a03-d4fd-4096-a611-3f8d7bb8b61b","year":2021},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:26.420932Z"},"links":{"citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:1cc7c8536703c0971abbda25c9b424d981f6c16c7cd36b99a0f327226a42302d","observation_id":"7b9bceae-6945-4ab4-a6e7-ff13b4b1149a","resolution":{"observed_at":"2026-08-06T15:18:37.121789Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:36.719209Z","title":"Segformer: Simple and efficient design for semantic segmentation with transform- ers","venue":null,"work_id":"217eca0e-dc59-4806-94fb-29df3a9955e3","year":2021},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:26.509897Z"},"links":{"citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:78f7933ca259212521169e5bd819fa6459f79d042ad59e163132f36f40a7227f","observation_id":"f9232427-c256-4bee-813b-835b78a47631","resolution":{"observed_at":"2026-08-06T15:18:36.863317Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:36.333832Z","title":"Semantics lead all: Towards unified image registration and fusion from a semantic perspective","venue":null,"work_id":"f1144adb-ef92-4902-bed6-c3630c417f04","year":2023},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:26.578515Z"},"links":{"citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:e7bc401cdd347e4b9734be811dc125af0cb32c1b392931524f2be6939268a70b","observation_id":"0c3b6c3a-630b-41e7-9f8a-6b99ea317684","resolution":{"observed_at":"2026-08-06T15:18:36.560050Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.05237","last_updated":"2024-05-08T17:33:42Z","snapshot_observed_at":"2026-08-13T00:12:10.220764Z","submitted_at":"2024-05-08T17:33:42Z","title":"EVA-X: A Foundation Model for General Chest X-ray Analysis with Self-supervised Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.05237","snapshot_observed_at":"2026-08-06T15:18:26.731053Z","title":"Eva- x: A foundation model for general chest x-ray analysis with self-supervised learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:26.731053Z"},"links":{"cited_paper":"/paper/2405.05237","citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:33d5715255c4f374c1fa85b7d6e8da227e839fb5aa9927879649a568ac5e03eb","observation_id":"64f4db7f-071b-4cb7-92fc-cb493c9e21da","resolution":{"observed_at":"2026-08-06T15:18:26.731053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:35.885932Z","title":"C 2 former: Calibrated and complementary transformer for rgb-infrared object de- tection","venue":null,"work_id":"fcd711fb-a074-42c6-9dc1-223421542f8d","year":2024},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:26.879020Z"},"links":{"citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:97fe744c0c3d5bf2b0377ae8f3ec6951179b5d42a6d756f2b2d4957637276a35","observation_id":"59ce5e09-8054-4f2d-bbc6-b0337172aecf","resolution":{"observed_at":"2026-08-06T15:18:36.116926Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:35.549568Z","title":"Transla- tion, scale and rotation: cross-modal alignment meets rgb- infrared vehicle detection","venue":null,"work_id":"ff0f8cae-9198-4f40-ae92-384ac69023a1","year":2022},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:26.946437Z"},"links":{"citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:9f4bf055a78ca189bd31908a6a56e9fd0298d903bb4c728da57719b3e29c1be5","observation_id":"0467d0d4-8753-4ed1-95f9-9ddf6a6133ab","resolution":{"observed_at":"2026-08-06T15:18:35.734915Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2404.17360","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:29.678626Z","title":"Unirgb-ir: A unified framework for visible-infrared downstream tasks via adapter tuning","venue":null,"work_id":"0d20d2b4-ac9b-43f1-91aa-d4d600d5d304","year":2024},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:27.007889Z"},"links":{"citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:12aea7294985b8d9c97d9c658a56f17215b55243b65145e21b3e27d569b1b4fd","observation_id":"831590ef-624c-4a47-90b3-e37e25b2a22b","resolution":{"observed_at":"2026-08-06T15:18:29.718363Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:35.269749Z","title":"Improving rgb-infrared object detection with cascade alignment-guided transformer","venue":null,"work_id":"3e7d3b16-58c9-4773-9809-e033cbed8ba4","year":2024},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:27.149417Z"},"links":{"citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:76e2cb118337bbc64d8389983fe52d7eeb684fcfdfe49b76bd88aca59df139c2","observation_id":"eec78eaa-d9a0-428a-88dc-d44e17dc9880","resolution":{"observed_at":"2026-08-06T15:18:35.406625Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:34.878848Z","title":"Object- contextual representations for semantic segmentation","venue":null,"work_id":"42fdceba-d093-4158-becb-02ae86f26815","year":2020},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:27.271528Z"},"links":{"citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:889c53f62e8b573eb4165430780b1774fe2ca9e9977dfb69f01f741b2916e463","observation_id":"87d4dd14-b968-4528-b75d-f014502e9b0a","resolution":{"observed_at":"2026-08-06T15:18:35.106773Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:34.530753Z","title":"Infusion-net: inter-and intra-weighted cross-fusion network for multispectral object detection","venue":null,"work_id":"cbb8e08e-4483-4c5e-938e-055032ea137f","year":2022},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:27.406381Z"},"links":{"citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:d734acafa5808b1380dc81213071df9f34b95afbebc0caabfee9152211923352","observation_id":"e0e15432-f5c6-4268-be9c-607cb5c03fdc","resolution":{"observed_at":"2026-08-06T15:18:34.715000Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:34.201766Z","title":"Mmi- det: Exploring multi-modal integration for visible and in- frared object detection","venue":null,"work_id":"627a99b9-a41b-416d-b770-65b6807f6e0b","year":2024},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:27.554499Z"},"links":{"citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:407a3444430abea63b6fa3749ffbb7c68df0f84d3376fa0efa7797706913e225","observation_id":"3c063278-dccc-4cc2-925c-d0955f70e683","resolution":{"observed_at":"2026-08-06T15:18:34.368260Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:33.758227Z","title":"Multispectral fusion for object detection with cyclic fuse-and-refine blocks","venue":null,"work_id":"711a0c3d-3779-4660-a968-846b13356abd","year":2020},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:27.635121Z"},"links":{"citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:481633ffc5f322cc3f046d850f672cfe62a36e8195c3b8654df2c8ec73c55bcb","observation_id":"b0a73ca1-a70c-4b45-a99d-9596c0c2c4ee","resolution":{"observed_at":"2026-08-06T15:18:33.989968Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:33.455473Z","title":"Guided attentive feature fusion for multispectral pedestrian detection","venue":null,"work_id":"7261a37d-5dc6-4857-bb8b-ace0a6893174","year":null},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:27.785278Z"},"links":{"citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:d32f5172b13adf5c6c4263ffc39cd4c214e63ece0dcb29bc5d5c91af1644406a","observation_id":"2a09ccab-ace5-4d36-ae25-8fa12e1a4c4f","resolution":{"observed_at":"2026-08-06T15:18:33.605120Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:33.010558Z","title":"Mrfs: Mutually reinforcing image fusion and segmenta- tion","venue":null,"work_id":"313d4c27-1449-4d4e-a404-27cbb52271eb","year":null},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:27.901089Z"},"links":{"citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:312b11979fe7fca46c3c466888105e9544d5b0350e9602f520044704ad01e0b4","observation_id":"e508ce9f-90dd-4767-bd80-5897bd21aa4e","resolution":{"observed_at":"2026-08-06T15:18:33.226818Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:32.673391Z","title":"Cross-modality interactive attention network for multispectral pedestrian de- tection","venue":null,"work_id":"0c5dcfba-72cb-4ff3-aa17-51197debf1e3","year":2019},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:27.972828Z"},"links":{"citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:2adbe584fd5801dcc2339b4291e8f3d2d0392cd1b3c450e0e1cb0c035cd3e514","observation_id":"bc50c436-24c7-411b-bf00-06be44d6474b","resolution":{"observed_at":"2026-08-06T15:18:32.860243Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1901.02645","last_updated":"2019-10-18T11:57:50Z","snapshot_observed_at":"2026-08-14T17:33:22.538096Z","submitted_at":"2019-01-09T09:16:36Z","title":"Weakly Aligned Cross-Modal Learning for Multispectral Pedestrian Detection","version":2},"cited_work":{"arxiv_id":"1901.02645","doi":null,"metadata_source":"pith","pith_arxiv_id":"1901.02645","snapshot_observed_at":"2026-08-06T15:18:29.385077Z","title":"Weakly Aligned Cross-Modal Learning for Multispectral Pedestrian Detection","venue":"cs.CV","work_id":"ae547d0a-fd06-424c-8d32-666181a7bb56","year":2019},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:28.133129Z"},"links":{"cited_paper":"/paper/1901.02645","citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:58d567907c223eb27dff722a24f5cd4c3b0dcf2df99c0476b379385673f31b73","observation_id":"d04d0ff7-1777-4a39-bc79-5698ff7b9a2e","resolution":{"observed_at":"2026-08-06T15:18:29.505739Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:32.311063Z","title":"Rgb-t salient object detec- tion via fusing multi-level cnn features","venue":null,"work_id":"17a212a9-c562-48d8-9dd9-bc122986868b","year":2019},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:28.246384Z"},"links":{"citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:d20f4bfd35fe381983a5b67e49b29b968effdac55507cdb763d3c33fc24ee965","observation_id":"391600ba-f51e-480c-8fbf-33c7e0561770","resolution":{"observed_at":"2026-08-06T15:18:32.454652Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:31.956490Z","title":"Abmdrnet: Adaptive-weighted bi-directional modality difference reduc- tion network for rgb-t semantic segmentation","venue":null,"work_id":"dc6906a7-2f08-4a0a-b1f1-2e76da857f53","year":2021},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:28.396941Z"},"links":{"citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:f0a7eb45c7824b3b33023d166b4a7063ad8543e4509d08e6cc95cef34f62d93d","observation_id":"8757a2cd-11ce-46cb-9ef0-80fd68d9521c","resolution":{"observed_at":"2026-08-06T15:18:32.123937Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:31.645983Z","title":"Mitigating modality discrepancies for rgb-t semantic segmentation","venue":null,"work_id":"99cf9f10-f150-47a9-a41b-32c2664499c6","year":2023},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:28.527189Z"},"links":{"citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:9399fb776913fee0debb8d01d77dfe643f65ddb9aa3bd0129741fecd2d1dcbd2","observation_id":"30c6e76e-b3c0-44ee-8957-ed37199f0b75","resolution":{"observed_at":"2026-08-06T15:18:31.790123Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:28.642748Z","title":"Removal and selection: Improving rgb- infrared object detection via coarse-to-fine fusion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:28.642748Z"},"links":{"citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:968c36a6135489f0784452f682a770a6d5aaac34ddcf12fa4a78bc570a3e4cc3","observation_id":"c12d4dd0-bca8-4488-886b-0f1f079df8dc","resolution":{"observed_at":"2026-08-06T15:18:28.642748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:31.304806Z","title":"Improving mul- tispectral pedestrian detection by addressing modality im- balance problems","venue":null,"work_id":"72402332-1541-44c2-9718-fe49abcb8f95","year":2020},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:28.776174Z"},"links":{"citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:0db06c099dd3a3051c15ce47e2cb9619ce88b191311d0b8ff742ec244fe5e957","observation_id":"3b868b17-7682-41a9-a6e1-9c2411a61bbc","resolution":{"observed_at":"2026-08-06T15:18:31.466248Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:30.962533Z","title":"Mffenet: Multiscale feature fusion and en- hancement network for rgb–thermal urban road scene pars- ing","venue":null,"work_id":"bfa18d05-0aff-49c8-8b14-a8c905d4452a","year":null},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:28.905138Z"},"links":{"citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:548bd78629982dc195a7ea4d73c10b01e5216efdd368a8fd3cd7e150ea653a3a","observation_id":"2cfb41fc-6e96-4efc-a9c8-520ce44f45cf","resolution":{"observed_at":"2026-08-06T15:18:31.114531Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:30.610290Z","title":"Edge-aware guidance fusion network for rgb–thermal scene parsing","venue":null,"work_id":"b74533db-1ade-4f35-a81b-4ef719d33ced","year":2022},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:29.016668Z"},"links":{"citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:42628efe3537fec1ea40a41193d0d25bb7b955911ceff03ee79b8f586cca4e97","observation_id":"512aba2d-5ce0-4b5f-9dcf-0a5b97ad51a5","resolution":{"observed_at":"2026-08-06T15:18:30.753979Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:30.240866Z","title":"Lsnet: Lightweight spatial boosting network for de- tecting salient objects in rgb-thermal images","venue":null,"work_id":"da95af1a-09e5-4cb5-89a8-aa94a0fe9c52","year":2023},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:29.140260Z"},"links":{"citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:3f2c1dc5d80d9934a8314e46a014a3ca0c057c0efb59948367098e1f55d19252","observation_id":"3ac11f5a-79bc-48e8-84f8-6ee4fe43939c","resolution":{"observed_at":"2026-08-06T15:18:30.437447Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision"},"reference_resolution":{"displayed":83,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":13,"verified_exact":4,"verified_fuzzy":66},"total_outbound_references":83},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 83 of 83 outbound references and 0 inbound Pith citation observations for arXiv:2507.16318."}