{"as_of":"2026-08-18T18:22:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f80c13502d02560b3e45d7c5ff4a81562f1a3a4930dd490d167b1f48c5ed0713","coverage":[{"denominator":75,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":75,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-14T10:47:25.822224Z","state":"measured"},{"denominator":75,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":75,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/1908.10534/citation-record","integrity":"/paper/1908.10534/integrity","json":"/paper/1908.10534/citation-record.json","paper":"/paper/1908.10534"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:47:27.118924Z","title":"Evaluation of output embeddings for ﬁne- grained image classiﬁcation","venue":null,"work_id":"c84c93ff-94d3-4e04-9080-c827883be9b9","year":2015},"citing_paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","snapshot_observed_at":"2026-08-16T18:54:08.148848Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:25.447635Z"},"links":{"citing_paper":"/paper/1908.10534"},"observation_digest":"sha256:bf9d19fac09c4e7f828f14594da0dfb1de17e7fc962c865e7fe82e1e3d267bae","observation_id":"5e213093-dd5b-48d6-ad22-07cc48489788","resolution":{"observed_at":"2026-08-14T10:47:27.124177Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:47:27.103281Z","title":"VQA: Visual question answering","venue":null,"work_id":"da415ffe-04e4-4069-9371-a7d9bf175601","year":2015},"citing_paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","snapshot_observed_at":"2026-08-16T18:54:08.148848Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:25.453319Z"},"links":{"citing_paper":"/paper/1908.10534"},"observation_digest":"sha256:961a1cdaa1ebe520dd58cc96effc5fcb230ac28fc979e3976e97176d127fce2d","observation_id":"1bda83a9-f9f5-4b06-96c5-dcc7294e0fd4","resolution":{"observed_at":"2026-08-14T10:47:27.108531Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:47:27.087761Z","title":"Curriculum learning","venue":null,"work_id":"75505f81-0b15-4e8a-b61c-cb025dc3546a","year":2009},"citing_paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","snapshot_observed_at":"2026-08-16T18:54:08.148848Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:25.458614Z"},"links":{"citing_paper":"/paper/1908.10534"},"observation_digest":"sha256:6f72f3abd1c627fc0ff2a8afc4b4b70fd6b01d08172686dd183a7a5c84597b65","observation_id":"89c62fc9-0040-46b3-8181-74800d201adb","resolution":{"observed_at":"2026-08-14T10:47:27.092882Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:47:27.071513Z","title":"Deep visual-semantic hashing for cross-modal retrieval","venue":null,"work_id":"5b27b1b5-6316-4cce-938c-b6086e025023","year":null},"citing_paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","snapshot_observed_at":"2026-08-16T18:54:08.148848Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:25.464529Z"},"links":{"citing_paper":"/paper/1908.10534"},"observation_digest":"sha256:8aa19950933b28019a2c8d68ab6053bd838aa19681d83cf983517b2949c9f27d","observation_id":"7cfe122e-5f73-4164-b2ab-95538506e28f","resolution":{"observed_at":"2026-08-14T10:47:27.076772Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:47:27.049068Z","title":"Partial adversarial domain adaptation","venue":null,"work_id":"9ab4e682-a076-4ffe-84f7-22f6e042690c","year":2018},"citing_paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","snapshot_observed_at":"2026-08-16T18:54:08.148848Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:25.470068Z"},"links":{"citing_paper":"/paper/1908.10534"},"observation_digest":"sha256:752783b2ee4b7e3ac06e4cd564d9b047b3deabb146f0870a66ffa9ef016b8641","observation_id":"d1bd34cb-a02f-43c3-84e3-1b4422a18e1c","resolution":{"observed_at":"2026-08-14T10:47:27.059321Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:47:27.029858Z","title":"Improving deep visual representation for person re-identiﬁcation by global and local image-language association","venue":null,"work_id":"451fb840-df22-4ff9-9321-47c7687208a5","year":2018},"citing_paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","snapshot_observed_at":"2026-08-16T18:54:08.148848Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:25.474987Z"},"links":{"citing_paper":"/paper/1908.10534"},"observation_digest":"sha256:ae32040d356c18b67cd098cced9d0f474db6653047567b2104cfece29700885d","observation_id":"c2ec46fd-0dbf-4ac9-87ab-7d60e83b2c88","resolution":{"observed_at":"2026-08-14T10:47:27.035298Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:47:27.013896Z","title":"Improving text-based person search by spatial matching and adaptive threshold","venue":null,"work_id":"6108e5c7-101f-4549-a5ae-430fb702e2f4","year":2018},"citing_paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","snapshot_observed_at":"2026-08-16T18:54:08.148848Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:25.479966Z"},"links":{"citing_paper":"/paper/1908.10534"},"observation_digest":"sha256:37c6dd3db2ccd48010c7b80d25c055ed75031af75d1444ed23d8ddf799de7974","observation_id":"dde8ecd2-c407-43c4-9286-77252a524baa","resolution":{"observed_at":"2026-08-14T10:47:27.019054Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:47:26.997239Z","title":"Beyond triplet loss: A deep quadruplet network for person re-identiﬁcation","venue":null,"work_id":"4d187b27-e60d-471a-9aec-338d1cbe6bf5","year":null},"citing_paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","snapshot_observed_at":"2026-08-16T18:54:08.148848Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:25.485180Z"},"links":{"citing_paper":"/paper/1908.10534"},"observation_digest":"sha256:f2c0dc7cd8ba790ed2836d2ebd8104f6ab9dad2ed5b0e1d07350a07bb36dd0f5","observation_id":"603626df-34b6-48b2-915a-8a4a613d8db1","resolution":{"observed_at":"2026-08-14T10:47:27.002916Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:47:26.981242Z","title":"How to train a GAN? Tips and tricks to make GANs work","venue":null,"work_id":"2148d5d2-110a-4efe-8b9e-02c72588a895","year":2016},"citing_paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","snapshot_observed_at":"2026-08-16T18:54:08.148848Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:25.489998Z"},"links":{"citing_paper":"/paper/1908.10534"},"observation_digest":"sha256:d4d5b2d0a33bb81248f77338e169fc06eed057141a97a3f17bc789d50502e1af","observation_id":"4181f257-6ea1-4347-a91f-8bb9cb8d13b9","resolution":{"observed_at":"2026-08-14T10:47:26.986827Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-08-14T18:16:28.847993Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-14T10:47:25.494828Z","title":"BERT: Pre-training of deep bidirectional transformers for language understanding","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","snapshot_observed_at":"2026-08-16T18:54:08.148848Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:25.494828Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/1908.10534"},"observation_digest":"sha256:560459a1c3605d5fc233b1fa99481f8c4ed3456d38175ecc60a8c4cf951ebb69","observation_id":"6d2cedf7-30dd-498f-9d52-3fd136bbf485","resolution":{"observed_at":"2026-08-14T10:47:25.494828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:47:26.964334Z","title":"Class rectiﬁ- cation hard mining for imbalanced deep learning","venue":null,"work_id":"e1904392-ec70-47b2-9267-4a666c37f9a7","year":2017},"citing_paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","snapshot_observed_at":"2026-08-16T18:54:08.148848Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:25.500174Z"},"links":{"citing_paper":"/paper/1908.10534"},"observation_digest":"sha256:9d5d79c24779cd77be82768a55439229792c03e66d84728128408780f3b55ade","observation_id":"42ac48ff-9e65-4233-9fc0-9136c2feca9a","resolution":{"observed_at":"2026-08-14T10:47:26.969793Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:47:26.948007Z","title":"VSE++: Improved visual-semantic embeddings","venue":null,"work_id":"53c16ab2-c6b7-48d2-a8d1-4aa983236b84","year":2018},"citing_paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","snapshot_observed_at":"2026-08-16T18:54:08.148848Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:25.505002Z"},"links":{"citing_paper":"/paper/1908.10534"},"observation_digest":"sha256:ffa0d3fde8d6b3bbb4bf5bb1a4c6c8435135b491bebcda505ec22641f606bb11","observation_id":"328afce4-67be-465b-9f2c-b90dd14e4ea6","resolution":{"observed_at":"2026-08-14T10:47:26.953156Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:47:26.931764Z","title":"Unsupervised domain adaptation by backpropagation","venue":null,"work_id":"eeb716bf-6086-49f9-b988-a2b40d6503d7","year":2015},"citing_paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","snapshot_observed_at":"2026-08-16T18:54:08.148848Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:25.509913Z"},"links":{"citing_paper":"/paper/1908.10534"},"observation_digest":"sha256:755334d5e3faa4845badb8ce3bd257c0155a9daa7767b42614bf43bb7f4f6194","observation_id":"7a14bbec-c011-4774-b6ed-81cf4f02a603","resolution":{"observed_at":"2026-08-14T10:47:26.937108Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:47:26.915499Z","title":"Generative adversarial nets","venue":null,"work_id":"d389a05e-f491-4a89-93f4-b65fb6261be8","year":null},"citing_paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","snapshot_observed_at":"2026-08-16T18:54:08.148848Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:25.514695Z"},"links":{"citing_paper":"/paper/1908.10534"},"observation_digest":"sha256:33c43b2fee1c93050c5d09a808c388dab472e1719f98b6510d23bf55bea00728","observation_id":"060b2c0c-ec83-4768-941b-d4510805e222","resolution":{"observed_at":"2026-08-14T10:47:26.920837Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:47:26.900028Z","title":"Look, imagine and match: Improving textual-visual cross-modal retrieval with generative models","venue":null,"work_id":"0bb9bae0-02d9-4e83-9597-440e8c8bdf5b","year":2018},"citing_paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","snapshot_observed_at":"2026-08-16T18:54:08.148848Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:25.519728Z"},"links":{"citing_paper":"/paper/1908.10534"},"observation_digest":"sha256:d7d8084d22a0b8bc67db8e5c85cdb136936142b041d7bc3b1eee51ea7593f719","observation_id":"c47dc8d4-e915-45d7-aeb6-7e1fd8f98eeb","resolution":{"observed_at":"2026-08-14T10:47:26.904883Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:47:26.883998Z","title":"Unsupervised cross-modal retrieval through adversarial learning","venue":null,"work_id":"685e0daf-00a6-4881-98c2-7eed4dee5879","year":2017},"citing_paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","snapshot_observed_at":"2026-08-16T18:54:08.148848Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:25.524375Z"},"links":{"citing_paper":"/paper/1908.10534"},"observation_digest":"sha256:023bc3ba0dc6d990ece3055f918e7e6f16c087ee5dfd8df2c8dae520136c2fa5","observation_id":"4efd3688-9730-4040-a0f5-669d3f3d801f","resolution":{"observed_at":"2026-08-14T10:47:26.889720Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:47:26.868545Z","title":"Long short-term memory","venue":null,"work_id":"bff0c3c6-378a-4e58-ba07-b856a8ff84b9","year":1997},"citing_paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","snapshot_observed_at":"2026-08-16T18:54:08.148848Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:25.529153Z"},"links":{"citing_paper":"/paper/1908.10534"},"observation_digest":"sha256:31b5074a38a0ca2cffeeb668a270190e0f98e6f11f476b75e9ea715f185d4a87","observation_id":"5b9be873-ee6f-49ac-9b3f-c7838e179dbf","resolution":{"observed_at":"2026-08-14T10:47:26.873186Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:47:26.853013Z","title":"Learning deep representation for imbalanced classiﬁ- cation","venue":null,"work_id":"1f424482-5356-4aae-8928-3273dcac92f1","year":2016},"citing_paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","snapshot_observed_at":"2026-08-16T18:54:08.148848Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:25.534101Z"},"links":{"citing_paper":"/paper/1908.10534"},"observation_digest":"sha256:6680b3a1e2c85d8f73baf813ff22ffd5972db5a89ae0498abba7b3c326fb0d45","observation_id":"0d28018c-f5ad-40de-ac77-28cb8c0ccdef","resolution":{"observed_at":"2026-08-14T10:47:26.858144Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:47:26.836844Z","title":"Bi-directional spatial-semantic attention networks for image-text matching","venue":null,"work_id":"298e66fa-5508-4733-9273-07a0814d7d32","year":2008},"citing_paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","snapshot_observed_at":"2026-08-16T18:54:08.148848Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:25.538786Z"},"links":{"citing_paper":"/paper/1908.10534"},"observation_digest":"sha256:d63e1b4cf5d643860fb600c4fc29d6a77ab10bee31e1d36a3d6c5bd45405a9da","observation_id":"2cbf248d-4a87-4b41-b5b2-d0304ba56430","resolution":{"observed_at":"2026-08-14T10:47:26.842172Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:47:26.820520Z","title":"Instance-aware im- age and sentence matching with selective multimodal LSTM","venue":null,"work_id":"283b7966-4faa-457c-87b9-7335316c5bf1","year":2017},"citing_paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","snapshot_observed_at":"2026-08-16T18:54:08.148848Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:25.543902Z"},"links":{"citing_paper":"/paper/1908.10534"},"observation_digest":"sha256:4f2d4a235306a84daf2f65f6a8a99bfdc4cf9d74d53f9eddd7098b1a47741375","observation_id":"efe864af-0ab9-422c-94a8-76038bdaa2e4","resolution":{"observed_at":"2026-08-14T10:47:26.825853Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:47:26.804963Z","title":"Learning semantic concepts and order for image and sen- tence matching","venue":null,"work_id":"d1e70105-400c-4539-8566-c2608fbb5e19","year":null},"citing_paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","snapshot_observed_at":"2026-08-16T18:54:08.148848Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:25.549136Z"},"links":{"citing_paper":"/paper/1908.10534"},"observation_digest":"sha256:4eeae1789826ac21d2cbe8ec5310425b7c5cbf2d95bde9a99c4f05b2ea9f7a7b","observation_id":"1580d3b3-974e-46b1-9220-3d889e44d014","resolution":{"observed_at":"2026-08-14T10:47:26.810056Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1809.08440","last_updated":"2019-11-27T03:03:21Z","snapshot_observed_at":"2026-08-18T17:59:31.352428Z","submitted_at":"2018-09-22T14:18:41Z","title":"Pose-Guided Multi-Granularity Attention Network for Text-Based Person Search","version":3},"cited_work":{"arxiv_id":"1809.08440","doi":null,"metadata_source":"pith","pith_arxiv_id":"1809.08440","snapshot_observed_at":"2026-08-14T10:47:25.978839Z","title":"Pose-Guided Multi-Granularity Attention Network for Text-Based Person Search","venue":"cs.CV","work_id":"81532e90-e366-473e-aeb9-c64564c49f36","year":2018},"citing_paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","snapshot_observed_at":"2026-08-16T18:54:08.148848Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:25.554205Z"},"links":{"cited_paper":"/paper/1809.08440","citing_paper":"/paper/1908.10534"},"observation_digest":"sha256:315a8d8b4f62a91e9f55e9d450da7fe1a41a815b337c0d0f5154ff28d6cff2f3","observation_id":"eb51cf19-f456-44ef-9c02-c9e6ab0cbfb6","resolution":{"observed_at":"2026-08-14T10:47:25.984639Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:47:26.789187Z","title":"Deep visual-semantic align- ments for generating image descriptions","venue":null,"work_id":"ad385ee4-4562-4b61-bdae-6c3603bdd98a","year":2015},"citing_paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","snapshot_observed_at":"2026-08-16T18:54:08.148848Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:25.559316Z"},"links":{"citing_paper":"/paper/1908.10534"},"observation_digest":"sha256:289ab1c14044d679fe3ed5cfecc890e2296a248516cee5f44ab99e5020c4aa89","observation_id":"00b0eb93-f9cf-4966-8a4e-24092bdfd008","resolution":{"observed_at":"2026-08-14T10:47:26.794296Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-08-17T19:26:44.032537Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-14T10:47:25.564546Z","title":"Adam: A method for stochastic optimization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","snapshot_observed_at":"2026-08-16T18:54:08.148848Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:25.564546Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/1908.10534"},"observation_digest":"sha256:5571daaf4a439a07429a11422eea99f5a8026f63d002eea182ca01805de85684","observation_id":"83346346-8060-4778-8a7c-cc408e82f637","resolution":{"observed_at":"2026-08-14T10:47:25.564546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:47:26.773246Z","title":"Asso- ciating neural word embeddings with deep image represen- tations using ﬁsher vectors","venue":null,"work_id":"6120cbb4-c27d-4f5e-a84e-e88110506203","year":2015},"citing_paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","snapshot_observed_at":"2026-08-16T18:54:08.148848Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:25.570271Z"},"links":{"citing_paper":"/paper/1908.10534"},"observation_digest":"sha256:7a047de6ffdb5210c97abd4bce29452072e94547844eaa50fb5d33c270427fc7","observation_id":"e5b5f5d7-04e1-4d4b-85b7-1561adc9b8a8","resolution":{"observed_at":"2026-08-14T10:47:26.778824Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:47:26.757092Z","title":"Self-supervised adversarial hashing networks for cross-modal retrieval","venue":null,"work_id":"cd21d0e8-1537-47a2-97bd-80bd6a620ed2","year":2018},"citing_paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","snapshot_observed_at":"2026-08-16T18:54:08.148848Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:25.575388Z"},"links":{"citing_paper":"/paper/1908.10534"},"observation_digest":"sha256:a6d90b658d9668678fa3cdc2a95980b2e60ed661bcd506884e6f79663e533fa3","observation_id":"e1c57e7c-d209-435f-8a6a-2fb3dd2de2f5","resolution":{"observed_at":"2026-08-14T10:47:26.762710Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:47:26.739015Z","title":"Identity-aware textual-visual matching with la- tent co-attention","venue":null,"work_id":"8a27ecba-8079-4dd1-8aef-0df6f0fdfd93","year":2017},"citing_paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","snapshot_observed_at":"2026-08-16T18:54:08.148848Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:25.580422Z"},"links":{"citing_paper":"/paper/1908.10534"},"observation_digest":"sha256:3595dd4d43492ab3d4ae9c57f56d7c12f2a273cc363ee051811c193878d9abe1","observation_id":"29637dfb-486a-4336-a83f-5e3fa5d3f24c","resolution":{"observed_at":"2026-08-14T10:47:26.745081Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:47:26.722873Z","title":"Person search with natural lan- guage description","venue":null,"work_id":"f000b86d-1f4d-4894-b9b9-6cb95020def7","year":2017},"citing_paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","snapshot_observed_at":"2026-08-16T18:54:08.148848Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:25.585291Z"},"links":{"citing_paper":"/paper/1908.10534"},"observation_digest":"sha256:fbffb322c23780d3e1183b33d73dcb972c423813cc50df518589dc0747074668","observation_id":"c553a3ab-d922-4d93-9edc-ca2553cdcc14","resolution":{"observed_at":"2026-08-14T10:47:26.728140Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:47:26.706849Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":"d85cf058-b9dd-413c-b628-4e168882c30d","year":2014},"citing_paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","snapshot_observed_at":"2026-08-16T18:54:08.148848Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:25.590480Z"},"links":{"citing_paper":"/paper/1908.10534"},"observation_digest":"sha256:f75237f990ddf82f82dd420bc5bbd6501e76090652f21435d2147af7b67a143b","observation_id":"10a7048c-5d67-4708-add4-a6dec3fa807f","resolution":{"observed_at":"2026-08-14T10:47:26.712155Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:47:26.691246Z","title":"Leveraging visual question an- swering for image-caption ranking","venue":null,"work_id":"b49b630c-0a57-421b-b2bc-1acd47351c0a","year":2016},"citing_paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","snapshot_observed_at":"2026-08-16T18:54:08.148848Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:25.595876Z"},"links":{"citing_paper":"/paper/1908.10534"},"observation_digest":"sha256:d4e4c8301cfe359758edae92319528a0d4e57b73a24b418d15347207ec387e0c","observation_id":"459de293-01f7-4f46-993a-75e8fa349c48","resolution":{"observed_at":"2026-08-14T10:47:26.696491Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:47:26.674794Z","title":"A neighbor-aware approach for image-text matching","venue":null,"work_id":"2efde940-c41f-4656-a89c-7b7dc791833b","year":null},"citing_paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","snapshot_observed_at":"2026-08-16T18:54:08.148848Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:25.601000Z"},"links":{"citing_paper":"/paper/1908.10534"},"observation_digest":"sha256:3826f671021e29a77f57227877177acc17137c650a3b8b8fcf41987507b69ef0","observation_id":"c864911f-2a71-4963-b59b-ce1748c3a9db","resolution":{"observed_at":"2026-08-14T10:47:26.680217Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:47:26.657323Z","title":"Sphereface: Deep hypersphere embed- ding for face recognition","venue":null,"work_id":"26bbdeab-8060-4b42-9123-80fc20677691","year":null},"citing_paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","snapshot_observed_at":"2026-08-16T18:54:08.148848Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:25.607524Z"},"links":{"citing_paper":"/paper/1908.10534"},"observation_digest":"sha256:58f6c0318b1f779700260965d11a7a1513b39adb21901377c32375f3787b6595","observation_id":"e0cd1e31-6c7a-4c96-b8b4-3805eb72ec83","resolution":{"observed_at":"2026-08-14T10:47:26.662837Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:47:26.641972Z","title":"Learning a recurrent residual fusion network for multimodal matching","venue":null,"work_id":"3a67fe59-48ce-4337-87ce-6c623c26f0b7","year":2017},"citing_paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","snapshot_observed_at":"2026-08-16T18:54:08.148848Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:25.612689Z"},"links":{"citing_paper":"/paper/1908.10534"},"observation_digest":"sha256:d1326aa25278e055e74cebcb1aaa1ed5c7474cdd8b324e38cac0c8239b6fde6c","observation_id":"2eb77bc6-0eb1-4d5a-9947-10f86e1e2708","resolution":{"observed_at":"2026-08-14T10:47:26.646909Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:47:26.626237Z","title":"Mul- timodal convolutional neural networks for matching image and sentence","venue":null,"work_id":"07ea33a3-5012-4228-b393-ddb70cc848af","year":2015},"citing_paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","snapshot_observed_at":"2026-08-16T18:54:08.148848Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:25.617618Z"},"links":{"citing_paper":"/paper/1908.10534"},"observation_digest":"sha256:ffa2920bc69220062f29f7871417588a4b9bc82ef75f11aa8ba205fc1091d9cd","observation_id":"a4377aaf-a9c4-41f2-92b7-c55d5bb9dade","resolution":{"observed_at":"2026-08-14T10:47:26.631168Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:47:26.610773Z","title":"Deep captioning with multimodal recurrent neural networks (m-RNN)","venue":null,"work_id":"14458855-8f02-4015-9add-dd269e311753","year":null},"citing_paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","snapshot_observed_at":"2026-08-16T18:54:08.148848Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:25.622798Z"},"links":{"citing_paper":"/paper/1908.10534"},"observation_digest":"sha256:1fdaa382e6c6f0e048f418fdce12926c576214b559bbdde41b06c9e4e5cc2df2","observation_id":"5ab8a181-3792-40e4-a373-c157979c1804","resolution":{"observed_at":"2026-08-14T10:47:26.615758Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:47:26.595202Z","title":"Distributed representations of words and phrases and their compositionality","venue":null,"work_id":"373d2ad2-64a3-416f-9a63-66e081a02c62","year":2013},"citing_paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","snapshot_observed_at":"2026-08-16T18:54:08.148848Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:25.627703Z"},"links":{"citing_paper":"/paper/1908.10534"},"observation_digest":"sha256:3d9d89bbf68803cbb98f6360f0b287d425ac1132bfcd67493b8c2cae36b70a65","observation_id":"34194aee-ca0e-4c75-8b2e-03165de37240","resolution":{"observed_at":"2026-08-14T10:47:26.600295Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:47:26.578361Z","title":"Learnable PINs: Cross-modal embeddings for person iden- tity","venue":null,"work_id":"79a1fe0c-3328-4771-a246-c4f092e05817","year":2018},"citing_paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","snapshot_observed_at":"2026-08-16T18:54:08.148848Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:25.632807Z"},"links":{"citing_paper":"/paper/1908.10534"},"observation_digest":"sha256:e3ffcc77c31543eefecc2916f315db16ce164c0b819c7cc188bd4f203163ec75","observation_id":"b882893b-e753-4e5e-8620-1fa7253a9b86","resolution":{"observed_at":"2026-08-14T10:47:26.584240Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:47:26.561824Z","title":"Dual attention networks for multimodal reasoning and matching","venue":null,"work_id":"9b402ee2-e0d5-4aa8-93cc-c8fc08da3c4a","year":2017},"citing_paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","snapshot_observed_at":"2026-08-16T18:54:08.148848Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:25.637459Z"},"links":{"citing_paper":"/paper/1908.10534"},"observation_digest":"sha256:151345782e86fcb44130e17e2d3b0dc1234d019a59f5b38d7c08f97f95355178","observation_id":"e3ec94cc-eeba-42cd-8b9d-b0a02185df62","resolution":{"observed_at":"2026-08-14T10:47:26.566843Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:47:26.545688Z","title":"Cm-gans: cross-modal genera- tive adversarial networks for common representation learn- ing","venue":null,"work_id":"9bcd5e10-8d87-4773-8f59-f3322b18bc57","year":2019},"citing_paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","snapshot_observed_at":"2026-08-16T18:54:08.148848Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:25.642292Z"},"links":{"citing_paper":"/paper/1908.10534"},"observation_digest":"sha256:56f0121dd7ab471076fc44e9ed772d8bb65d72cd895cd6f573c650aae7460ce8","observation_id":"714f20cc-b054-4402-9cad-160a5cf14321","resolution":{"observed_at":"2026-08-14T10:47:26.550984Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:47:26.529501Z","title":"Deep contextualized word representations","venue":null,"work_id":"1a5382e0-dfd9-4483-8862-5526df7e1f45","year":2018},"citing_paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","snapshot_observed_at":"2026-08-16T18:54:08.148848Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:25.647342Z"},"links":{"citing_paper":"/paper/1908.10534"},"observation_digest":"sha256:c16c85e69ab56a96742e8c324f20cd80388c4310ace89efb189ee6599830e549","observation_id":"90659941-0879-4284-8990-7da62ebcb5d3","resolution":{"observed_at":"2026-08-14T10:47:26.534529Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:47:26.512757Z","title":"Flickr30k entities: Collecting region-to-phrase corre- spondences for richer image-to-sentence models","venue":null,"work_id":"57ecc727-f46b-4495-960d-75edc9a7e1e9","year":2015},"citing_paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","snapshot_observed_at":"2026-08-16T18:54:08.148848Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:25.652388Z"},"links":{"citing_paper":"/paper/1908.10534"},"observation_digest":"sha256:f261bac86c5e03aa234525e82a1c88861250a7c3c83507df07d7715a510358b9","observation_id":"8f757e16-94c4-42fb-ab70-0e31b9900125","resolution":{"observed_at":"2026-08-14T10:47:26.518111Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:47:26.496429Z","title":"MirrorGAN: Learning text-to-image generation by re- description","venue":null,"work_id":"2acd88cb-34a2-46f6-9fcf-9abb8d053a5b","year":2019},"citing_paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","snapshot_observed_at":"2026-08-16T18:54:08.148848Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:25.658461Z"},"links":{"citing_paper":"/paper/1908.10534"},"observation_digest":"sha256:867a06e072afb75dbba1c1ff2548e5d8db85f71ee04642562c9aa197756801b6","observation_id":"98b4b943-00de-4588-a475-6f9aff56e535","resolution":{"observed_at":"2026-08-14T10:47:26.501737Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:47:25.663249Z","title":"Improving language understanding with unsuper- vised learning","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","snapshot_observed_at":"2026-08-16T18:54:08.148848Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:25.663249Z"},"links":{"citing_paper":"/paper/1908.10534"},"observation_digest":"sha256:cb04801a4eb85d688d639f96c575af2b41a4a13128aeb2d7874dd73c771622d7","observation_id":"5e252971-fba3-43b8-a2f8-a680906a5410","resolution":{"observed_at":"2026-08-14T10:47:25.663249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:47:26.470171Z","title":"Learning deep representations of ﬁne-grained visual descrip- tions","venue":null,"work_id":"c8c27caf-6c88-4db4-880b-202fba79c18c","year":2016},"citing_paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","snapshot_observed_at":"2026-08-16T18:54:08.148848Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:25.668076Z"},"links":{"citing_paper":"/paper/1908.10534"},"observation_digest":"sha256:5de1a3ae1d4e741b1d218db006ce469925419ba0ef1b59b3f40f82a3506f8e9c","observation_id":"02a71180-cdff-4ebd-ad46-67ba96e5e2d8","resolution":{"observed_at":"2026-08-14T10:47:26.475119Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:47:26.454145Z","title":"Cur- riculum learning for multi-task classiﬁcation of visual attributes","venue":null,"work_id":"0f850bb6-b539-4b98-a269-d34a73a92e1c","year":2017},"citing_paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","snapshot_observed_at":"2026-08-16T18:54:08.148848Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:25.673146Z"},"links":{"citing_paper":"/paper/1908.10534"},"observation_digest":"sha256:11d452c0e4510a4bce763031d32a2582e7a3099b35de645fc1077856b686522f","observation_id":"17259303-cc29-4588-9a76-f34961909d7b","resolution":{"observed_at":"2026-08-14T10:47:26.459714Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:47:26.438438Z","title":"Cur- riculum learning of visual attribute clusters for multi-task classiﬁcation","venue":null,"work_id":"87457554-8ad0-4b52-8379-f6c5504bcfdf","year":2018},"citing_paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","snapshot_observed_at":"2026-08-16T18:54:08.148848Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:25.677885Z"},"links":{"citing_paper":"/paper/1908.10534"},"observation_digest":"sha256:871c219ce75b1e3b643399b2341a554132a80742b40035b612196b30dd76d5de","observation_id":"7c0a53a3-3580-4133-a332-8a28dc14209d","resolution":{"observed_at":"2026-08-14T10:47:26.443914Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:47:26.423163Z","title":"Deep imbalanced attribute classiﬁcation using visual atten- tion aggregation","venue":null,"work_id":"1c64fde3-0aba-4a22-b62a-bf7d5104d6bf","year":2018},"citing_paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","snapshot_observed_at":"2026-08-16T18:54:08.148848Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:25.682505Z"},"links":{"citing_paper":"/paper/1908.10534"},"observation_digest":"sha256:5475944d2e9b36dc7d1f03fc82745d5d93246138aa2de0c75bad8f7ac8d15045","observation_id":"901523ab-e731-4a88-b99c-6f83d6941101","resolution":{"observed_at":"2026-08-14T10:47:26.428099Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:47:26.407369Z","title":"Facenet: A uniﬁed embedding for face recognition and clus- tering","venue":null,"work_id":"84116737-7c06-470b-8fbd-d39ca8c63b2d","year":2015},"citing_paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","snapshot_observed_at":"2026-08-16T18:54:08.148848Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:25.687743Z"},"links":{"citing_paper":"/paper/1908.10534"},"observation_digest":"sha256:5c00aed06dc6a2f175ad40ce2e5667de4bbee606320e983d528e196f63559090","observation_id":"6031bba0-2f59-4950-9d6a-f897a8957095","resolution":{"observed_at":"2026-08-14T10:47:26.412490Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:47:26.391786Z","title":"Video google: A text retrieval approach to object matching in videos","venue":null,"work_id":"e9691d23-ad99-4041-8ae0-fa38f6278871","year":2003},"citing_paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","snapshot_observed_at":"2026-08-16T18:54:08.148848Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:25.692329Z"},"links":{"citing_paper":"/paper/1908.10534"},"observation_digest":"sha256:abb7f228437cee04f2d65a138426d4b67369a21658949010908b05171786e540","observation_id":"3755febd-d215-4f72-838d-4c8e037c0409","resolution":{"observed_at":"2026-08-14T10:47:26.396796Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:47:26.375518Z","title":"Improved deep metric learning with multi- class n-pair loss objective","venue":null,"work_id":"8cc35377-8083-4829-82a9-48c643af853a","year":null},"citing_paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","snapshot_observed_at":"2026-08-16T18:54:08.148848Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:25.697003Z"},"links":{"citing_paper":"/paper/1908.10534"},"observation_digest":"sha256:9814e13f70f5f339c011bf03b7324a863cfb9e0e71e569c54bb392ca498f87f4","observation_id":"3e6b5a59-57f4-4baa-ba3c-040e7823244a","resolution":{"observed_at":"2026-08-14T10:47:26.381087Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:47:26.359265Z","title":"Polysemous visual- semantic embedding for cross-modal retrieval","venue":null,"work_id":"dd409fa9-a91b-44f6-9b8c-65accdf70481","year":2019},"citing_paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","snapshot_observed_at":"2026-08-16T18:54:08.148848Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:25.701765Z"},"links":{"citing_paper":"/paper/1908.10534"},"observation_digest":"sha256:af727cd97dbb32146e719dd0cfbeaa518d0370aa2c443ae2f14a4d8192418875","observation_id":"87f8e74b-c3b7-4c72-9168-ea20f362eeb7","resolution":{"observed_at":"2026-08-14T10:47:26.364325Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1901.08616","last_updated":"2020-03-02T17:08:34Z","snapshot_observed_at":"2026-08-14T17:26:15.893720Z","submitted_at":"2019-01-24T19:19:31Z","title":"Boosting Standard Classification Architectures Through a Ranking Regularizer","version":3},"cited_work":{"arxiv_id":"1901.08616","doi":null,"metadata_source":"pith","pith_arxiv_id":"1901.08616","snapshot_observed_at":"2026-08-14T10:47:25.932446Z","title":"Boosting Standard Classification Architectures Through a Ranking Regularizer","venue":"cs.CV","work_id":"fbd17dd0-9f2a-4f32-8aef-5cfe032283a3","year":2019},"citing_paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","snapshot_observed_at":"2026-08-16T18:54:08.148848Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:25.706885Z"},"links":{"cited_paper":"/paper/1901.08616","citing_paper":"/paper/1908.10534"},"observation_digest":"sha256:a0a30259e265529c5ca2eadd77caf6d40f65dad6f3f6b845898a0bb9a4d2a4db","observation_id":"393f018c-b7fe-48f7-9b97-29f3696bcbd8","resolution":{"observed_at":"2026-08-14T10:47:25.941177Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:47:26.343529Z","title":"Simultaneous deep transfer across domains and tasks","venue":null,"work_id":"e9792649-520e-47d2-8014-c16857bc9cb2","year":2015},"citing_paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","snapshot_observed_at":"2026-08-16T18:54:08.148848Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:25.712752Z"},"links":{"citing_paper":"/paper/1908.10534"},"observation_digest":"sha256:7b31208c925cd741c9382811b96d5fd826586d6244a30f8a5931d09861eded27","observation_id":"e771b105-e84d-49cc-ba5f-3928ee4e69c0","resolution":{"observed_at":"2026-08-14T10:47:26.348676Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:47:26.328015Z","title":"Learning deep embeddings with histogram loss","venue":null,"work_id":"e38cf756-3ecf-4384-b54f-b3e5138a45ee","year":2016},"citing_paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","snapshot_observed_at":"2026-08-16T18:54:08.148848Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:25.717862Z"},"links":{"citing_paper":"/paper/1908.10534"},"observation_digest":"sha256:5ae9a0c0bb8899595de430ebea18408373a3e5aa992d7b2291cf2161f228bba9","observation_id":"8d5940ef-a144-4723-94f1-74b69dcb07f4","resolution":{"observed_at":"2026-08-14T10:47:26.333228Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:47:26.311545Z","title":"Attention is all you need","venue":null,"work_id":"883f414f-578a-418b-8f78-95cf73270b11","year":null},"citing_paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","snapshot_observed_at":"2026-08-16T18:54:08.148848Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:25.722734Z"},"links":{"citing_paper":"/paper/1908.10534"},"observation_digest":"sha256:fd5dc41b300eda91d5f50c8635f3fdee15cdedc53dacd31a0028e8a87fcc3aa9","observation_id":"77d07bf8-b3fb-41fb-a216-c567fa20d595","resolution":{"observed_at":"2026-08-14T10:47:26.316580Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:47:26.295468Z","title":"Show and tell: A neural image caption gen- erator","venue":null,"work_id":"58ab87f1-15c4-49fd-9bf9-80ceca51186a","year":2015},"citing_paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","snapshot_observed_at":"2026-08-16T18:54:08.148848Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:25.727354Z"},"links":{"citing_paper":"/paper/1908.10534"},"observation_digest":"sha256:3838ade1e5f4f46c551575d0f3741826f3104cd6cd730509cac7bd969b22c9e6","observation_id":"d83f70f2-f718-4cb6-a0d4-aefe27da0af1","resolution":{"observed_at":"2026-08-14T10:47:26.300862Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:47:26.279140Z","title":"Adversarial cross-modal retrieval","venue":null,"work_id":"5a329179-9a48-4098-88ee-ba04ed17abea","year":2017},"citing_paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","snapshot_observed_at":"2026-08-16T18:54:08.148848Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:25.732761Z"},"links":{"citing_paper":"/paper/1908.10534"},"observation_digest":"sha256:cd01335df7fe65242309167f410d371561665e38f31c1913de80f42dad4a6169","observation_id":"29230eef-74ff-4be1-b209-e7e2d91fa404","resolution":{"observed_at":"2026-08-14T10:47:26.284393Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:47:26.263259Z","title":"Normface: l 2 hypersphere embedding for face veriﬁ- cation","venue":null,"work_id":"4d6f6195-97f4-428f-a966-f7965916713a","year":2017},"citing_paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","snapshot_observed_at":"2026-08-16T18:54:08.148848Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:25.738438Z"},"links":{"citing_paper":"/paper/1908.10534"},"observation_digest":"sha256:5fa7be9bcce667c4c66fe7ac4d11a869d8d34939741de564537eb0074e4ff4b6","observation_id":"5e4da735-8a23-4e37-9d94-f092c7a9484b","resolution":{"observed_at":"2026-08-14T10:47:26.268290Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:47:26.245978Z","title":"Learning deep structure-preserving image-text embeddings","venue":null,"work_id":"3d4e5918-7ef0-4073-837b-d983ac395cff","year":2016},"citing_paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","snapshot_observed_at":"2026-08-16T18:54:08.148848Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:25.743114Z"},"links":{"citing_paper":"/paper/1908.10534"},"observation_digest":"sha256:0370a2cd07f7da7bd3c441ffb5d84f51e8c47be0fa519952f6fa1f749da2c60e","observation_id":"05cb247a-0b19-4a07-8437-7d336161e702","resolution":{"observed_at":"2026-08-14T10:47:26.252269Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:47:26.229440Z","title":"Joint global and co-attentive represen- tation learning for image-sentence retrieval","venue":null,"work_id":"0e41df89-f540-4a43-8235-28f9956c7d05","year":null},"citing_paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","snapshot_observed_at":"2026-08-16T18:54:08.148848Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:25.747915Z"},"links":{"citing_paper":"/paper/1908.10534"},"observation_digest":"sha256:d6ed2eed589df957f11557b3b25624efbdd3f34c6bed60d3cbb95b006dc7a12d","observation_id":"1fa46f48-b9e1-4949-8101-596e7c01f177","resolution":{"observed_at":"2026-08-14T10:47:26.234538Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:47:26.213496Z","title":"Multilevel language and vision integration for text-to-clip re- trieval","venue":null,"work_id":"2caa93d2-17c1-40ac-8085-39b7919c5187","year":2019},"citing_paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","snapshot_observed_at":"2026-08-16T18:54:08.148848Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:25.753059Z"},"links":{"citing_paper":"/paper/1908.10534"},"observation_digest":"sha256:60b7085a7cd78d3d6e592c978b6a245472f688002225111137d6b8b90ca2ce24","observation_id":"fe1016af-796b-4226-9b78-68512094e660","resolution":{"observed_at":"2026-08-14T10:47:26.218505Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:47:26.195594Z","title":"Attngan: Fine- grained text to image generation with attentional generative adversarial networks","venue":null,"work_id":"daf626ed-7e22-4bc0-84bf-8fe002d5a044","year":null},"citing_paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","snapshot_observed_at":"2026-08-16T18:54:08.148848Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:25.757864Z"},"links":{"citing_paper":"/paper/1908.10534"},"observation_digest":"sha256:a1e1b6b46cd1cba2be38c1c5f284d61ac4a12e96ab0093e1af3449ee3aee91c7","observation_id":"205ed384-1f99-4a09-aeb8-4093a68e3a60","resolution":{"observed_at":"2026-08-14T10:47:26.201198Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:47:26.178778Z","title":"Deep adversarial metric learning for cross-modal retrieval","venue":null,"work_id":"49fd9243-dbcb-4e19-bfe7-31d960f6c9de","year":2019},"citing_paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","snapshot_observed_at":"2026-08-16T18:54:08.148848Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:25.762447Z"},"links":{"citing_paper":"/paper/1908.10534"},"observation_digest":"sha256:95c7cd1ba26c026686d85382b369b82ace641a2959d6a8c36283ec441f4af7a0","observation_id":"4ba08573-8fa5-407f-87eb-9023825e7bf5","resolution":{"observed_at":"2026-08-14T10:47:26.184341Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:47:26.162570Z","title":"Evaluation of a 3D-aided pose invariant 2D face recognition system","venue":null,"work_id":"581effc8-1562-4b0a-a805-782879f823b3","year":2017},"citing_paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","snapshot_observed_at":"2026-08-16T18:54:08.148848Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:25.767176Z"},"links":{"citing_paper":"/paper/1908.10534"},"observation_digest":"sha256:4eefb141f0d6b42417eabe72fc8dbd3eade6edf89f0aed63cbbb8c2f15286c2b","observation_id":"23ce2771-e729-4728-98fd-23e5315dbeac","resolution":{"observed_at":"2026-08-14T10:47:26.167723Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:47:26.146432Z","title":"d-SNE: Domain adap- tation using stochastic neighborhood embedding","venue":null,"work_id":"e5fee5a3-53e7-4001-bbc0-55881d4fd65b","year":2019},"citing_paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","snapshot_observed_at":"2026-08-16T18:54:08.148848Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:25.772167Z"},"links":{"citing_paper":"/paper/1908.10534"},"observation_digest":"sha256:8ba69a4c8d9ff882c7425540e2385484547d792fab4c3707879618f756d32740","observation_id":"5419cee9-009a-47aa-ba4a-bb9b8cafc7be","resolution":{"observed_at":"2026-08-14T10:47:26.151402Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:47:26.129337Z","title":"Deep correlation for matching images and text","venue":null,"work_id":"1ff15eb1-0a86-470d-9105-49cfa2cfbb6d","year":2015},"citing_paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","snapshot_observed_at":"2026-08-16T18:54:08.148848Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:25.777113Z"},"links":{"citing_paper":"/paper/1908.10534"},"observation_digest":"sha256:ede33864c8ff41b55a49762a33bb141c98a19fee081d0aa347333190f73c085f","observation_id":"c4678ad7-137d-474d-acbe-fef47ae86a5f","resolution":{"observed_at":"2026-08-14T10:47:26.135034Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:47:25.782027Z","title":"From image descriptions to visual denotations: New similarity metrics for semantic inference over event descrip- tions","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","snapshot_observed_at":"2026-08-16T18:54:08.148848Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:25.782027Z"},"links":{"citing_paper":"/paper/1908.10534"},"observation_digest":"sha256:a04717cb0c330f381a577bc3d38301879dcbdf84f498150f454a81c326390dc3","observation_id":"967b307f-8b1c-493f-a9aa-513ef45ba84f","resolution":{"observed_at":"2026-08-14T10:47:25.782027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:47:26.100867Z","title":"Cross-modal and hierarchical modeling of video and text","venue":null,"work_id":"172cb218-1848-4ff3-a8f3-92cdc9b1dab4","year":2018},"citing_paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","snapshot_observed_at":"2026-08-16T18:54:08.148848Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:25.786753Z"},"links":{"citing_paper":"/paper/1908.10534"},"observation_digest":"sha256:bbb815e2b694dc07aa4b29256c1e0cc6521521a7d04b40bf6047f643276cf8a6","observation_id":"ccafdcd6-8a0c-41b9-947b-55f0e264a5cf","resolution":{"observed_at":"2026-08-14T10:47:26.107039Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.00087","last_updated":"2019-05-17T23:15:57Z","snapshot_observed_at":"2026-08-14T17:50:19.265807Z","submitted_at":"2018-11-30T23:04:10Z","title":"MAN: Moment Alignment Network for Natural Language Moment Retrieval via Iterative Graph Adjustment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.00087","snapshot_observed_at":"2026-08-14T10:47:25.791817Z","title":"Man: Moment alignment network for natu- ral language moment retrieval via iterative graph adjustment","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","snapshot_observed_at":"2026-08-16T18:54:08.148848Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:25.791817Z"},"links":{"cited_paper":"/paper/1812.00087","citing_paper":"/paper/1908.10534"},"observation_digest":"sha256:03408f5e9b762fbb004dba79e6fc4f03e34a718871e2cc94cc934ccbc7592c62","observation_id":"c72ec8c4-f433-4edf-ab3f-0cfd0cf0917c","resolution":{"observed_at":"2026-08-14T10:47:25.791817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:47:26.082255Z","title":"Stack- gan: Text to photo-realistic image synthesis with stacked generative adversarial networks","venue":null,"work_id":"117112d2-d370-49f0-8bc1-db6a154989f2","year":2017},"citing_paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","snapshot_observed_at":"2026-08-16T18:54:08.148848Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:25.796846Z"},"links":{"citing_paper":"/paper/1908.10534"},"observation_digest":"sha256:fb3c72d60afd922e1f051184f2208104707b349356981a908b9a3fa91b067cfe","observation_id":"153d570f-6054-4473-b1fe-cf5287c634ea","resolution":{"observed_at":"2026-08-14T10:47:26.087947Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:47:26.061161Z","title":"Deep cross-modal projection learning for image-text matching","venue":null,"work_id":"f5628317-c20f-4a39-b486-ac61e7c5f458","year":null},"citing_paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","snapshot_observed_at":"2026-08-16T18:54:08.148848Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:25.801464Z"},"links":{"citing_paper":"/paper/1908.10534"},"observation_digest":"sha256:9ccb17a28ba809dc72ffd329fdcdd39997bb5dbc1a237a995d6d5540aa17a069","observation_id":"728443bb-f9bf-4a5b-9942-a4e9c822a7cd","resolution":{"observed_at":"2026-08-14T10:47:26.070212Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05535","last_updated":"2021-07-27T07:45:26Z","snapshot_observed_at":"2026-08-14T20:13:29.131358Z","submitted_at":"2017-11-15T12:40:11Z","title":"Dual-Path Convolutional Image-Text Embeddings with Instance Loss","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05535","snapshot_observed_at":"2026-08-14T10:47:25.810913Z","title":"Dual-path convolutional image- text embedding with instance loss","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","snapshot_observed_at":"2026-08-16T18:54:08.148848Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:25.810913Z"},"links":{"cited_paper":"/paper/1711.05535","citing_paper":"/paper/1908.10534"},"observation_digest":"sha256:2f07ee29c1b1c2ff50b17515806b544cff322b0ebf1bdaab3569311e40a6dbd3","observation_id":"6b28dac3-76b1-4bfb-8d07-437843ed5c37","resolution":{"observed_at":"2026-08-14T10:47:25.810913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1512.02167","last_updated":"2015-12-15T05:17:49Z","snapshot_observed_at":"2026-08-14T22:19:39.710069Z","submitted_at":"2015-12-07T19:00:54Z","title":"Simple Baseline for Visual Question Answering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1512.02167","snapshot_observed_at":"2026-08-14T10:47:25.816926Z","title":"Simple baseline for visual question answering","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","snapshot_observed_at":"2026-08-16T18:54:08.148848Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:25.816926Z"},"links":{"cited_paper":"/paper/1512.02167","citing_paper":"/paper/1908.10534"},"observation_digest":"sha256:4f479746ca41b59dd3588af3359b233e19e07c1b3a2834424ea8280b43dda515","observation_id":"693a215d-86c1-49b6-92b3-a46ac9131ed1","resolution":{"observed_at":"2026-08-14T10:47:25.816926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:47:26.019200Z","title":"R2GAN: Cross-modal recipe retrieval with generative adver- sarial network","venue":null,"work_id":"4430e42b-25e8-4ebc-8f52-addfa9517ada","year":2019},"citing_paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","snapshot_observed_at":"2026-08-16T18:54:08.148848Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:25.822224Z"},"links":{"citing_paper":"/paper/1908.10534"},"observation_digest":"sha256:f8a6d1b99c2fd5a919a9c1977fd164ee005c131adf86c12d1e864062ebd34eec","observation_id":"de35d3e4-1003-4567-9bd5-218d88ef8460","resolution":{"observed_at":"2026-08-14T10:47:26.025297Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:47:26.038378Z","title":null,"venue":null,"work_id":"c4914389-ad27-442e-8648-fb2d630edd90","year":null},"citing_paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","snapshot_observed_at":"2026-08-16T18:54:08.148848Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:25.806242Z"},"links":{"citing_paper":"/paper/1908.10534"},"observation_digest":"sha256:02b61102f416f2a3037cdd233efcba0b16e7931c75600a0733b6e2ad7be19142","observation_id":"96237542-414a-4caa-85e8-95744dbc61cc","resolution":{"observed_at":"2026-08-14T10:47:26.046191Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T18:54:08.148848Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching"},"reference_resolution":{"displayed":75,"state_counts":{"malformed_identifier":1,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":8,"verified_exact":1,"verified_fuzzy":64},"total_outbound_references":75},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 75 of 75 outbound references and 0 inbound Pith citation observations for arXiv:1908.10534."}