Instructions to use amauczka/APA-embed-embeddinggemma-300m-g39-v1.0 with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- sentence-transformers
How to use amauczka/APA-embed-embeddinggemma-300m-g39-v1.0 with sentence-transformers:
from sentence_transformers import SentenceTransformer model = SentenceTransformer("amauczka/APA-embed-embeddinggemma-300m-g39-v1.0") sentences = [ "task: search result | query: Hoe hebben Europese aandelenbeurzen en bedrijven gedaan als gevolg van economische zorgen, de Porsche-beursgang en de impact van oorlog en inflatie?", "title: none | text: IMG krijgt 800 schademeldingen na aardbevingen in Groningen (2)\n\n\nN i e u w bericht, meer informatie in laatste 2 alinea's\n\n\nGRONINGEN (ANP) - Het Instituut Mijnbouwschade Groningen (IMG) heeft sinds de aardbevingen bij Uithuizermeeden en Uithuizen afgelopen weekend 800 schademeldingen ontvangen. Zaterdagavond, de dag van de bevingen, stond de teller nog op 52. De Groningse dorpen werden 's middags opgeschrikt door bevingen met een kracht van respectievelijk 2.7 en 1.7.\n\n\nVan de 800 meldingen kwamen er 179 uit het zogeheten effectgebied, de zone rond de epicentra van de bevingen. Binnen het effectgebied liggen behalve Uithuizermeeden en Uithuizen ook plaatsen als Loppersum, Middelstum en Roodeschool. Ook uit verder weg gelegen plaatsen als de stad Groningen (167), Haren (21), Veendam (20), Hoogezand (17) en Winschoten (14) kwamen schademeldingen. Uit Friesland kwamen ook enkele meldingen, aldus het IMG.\n\n\nHet instituut ontving 18 meldingen over een mogelijk acuut onveilige situatie, waarvan er 10 uit het effectgebied kwamen. In 2 gevallen zijn er na inspectie \"aanvullende veiligheidsmaatregelen\" getroffen, aldus het IMG.\n\n\nVan de 800 schademelders hebben er 306 gekozen voor de vaste vergoeding van 5000 euro om de schade mee af te handelen. De overigen hebben gekozen voor een zogeheten maatwerkprocedure. In dat geval komt er een deskundige langs om de oorzaak en omvang van de schade te onderzoeken. Ook is het mogelijk om in plaats van een vergoeding de schade te laten herstellen.\n\n\nDe gemeente Het Hogeland, waar Uithuizermeeden en Uithuizen onder vallen, houdt maandagavond samen met het KNMI en het Staatstoezicht op de Mijnen (SodM) een informatiebijeenkomst over de recente bevingen. Volgens de gemeente hebben die \"weer veel impact op bewoners\" en gaat het om \"een opvallende serie aardbevingen\".", "title: none | text: MotoGP volgend jaar ook voor het eerst naar India (2)\n\n\nN i e u w bericht, meer informatie na 3e alinea\n\n\nBURIRAM (ANP) - De motorcoureurs in de WK wegrace gaan volgend jaar voor het eerst naar India. De organisator van de MotoGP heeft een contract gesloten met het circuit van Buddh, dat ten zuiden van hoofdstad New Delhi ligt. Op dat circuit werden tussen 2011 en 2013 al drie races in de Formule 1 gehouden, allemaal gewonnen door de Duitser Sebastian Vettel namens Red Bull.\n\n\n\"We hebben veel motorsportfans in India en we zijn heel blij dat we de sport naar hen toe kunnen brengen\", zegt directeur Carmelo Ezpeleta van Dorna, de promotor en rechtenhouder van de MotoGP.\n\n\nEerder deze week meldde de MotoGP al dat volgend jaar voor het eerst een Grand Prix in Kazachstan wordt gehouden, op het Sokol-circuit in de buurt van Almaty. De MotoGP sloot een contract voor vijf jaar met Kazachstan.\n\n\nOp de voorlopige kalender voor 2023 staat de GP van Kazachstan gepland voor 9 juli, twee weken na de TT van Assen (25 juni). Het circuit in Drenthe huisvest de achtste grand prix van het jaar. De kalender bestaat uit 21 races in achttien landen. Dat is één race meer dan dit jaar. India staat op het programma voor 24 september, de veertiende race van het seizoen. De motorcoureurs sluiten het jaar zoals gebruikelijk in november af in Valencia.\n\n\nQatar mocht de afgelopen jaren steeds de openingsrace organiseren, maar is nu verplaatst naar de slotfase van het seizoen. De GP van Qatar staat op de kalender voor 19 november, een week voor de slotrace in Valencia. Het seizoen begint nu op 26 maart met de GP van Portugal.\n\n\nMomenteel zijn de motorcoureurs in Thailand, waar zondag de zeventiende GP van dit seizoen wordt verreden. Begin november is in Valencia de twintigste en laatste race.", "title: none | text: Beurzen omlaag ondanks winsten Wall Street, Porsche stijgt\n\n\nAMSTERDAM (ANP) - De Europese aandelenbeurzen zijn donderdag lager geopend, ondanks de winsten op Wall Street een dag eerder. Beleggers bleven voorzichtig door zorgen over een economische recessie. Op de beurs in Frankfurt ging de aandacht vooral uit naar de beursgang van automerk Porsche. Met die beursgang haalde Porsche-moederbedrijf Volkswagen 9,4 miljard euro op, waarmee het de grootste aandelenverkoop in Frankfurt is sinds 1996.\n\n\nDe AEX-index in Amsterdam noteerde in de vroege handel 1,1 procent lager op 633, punten. De MidKap zakte 1,4 procent tot 839,41 punten. De hoofdgraadmeters in Parijs, Londen en Frankfurt gingen tot 1,3 procent omlaag.\n\n\nPorsche ging bij opening bijna 2 procent omhoog. De aandelen Porsche werden voor een prijs van 82,50 euro per stuk verkocht. Met die aandelenverkoop werd een prijskaartje aan het luxemerk uit Stuttgart gehangen van 75 miljard euro. Porsche is daarmee meer waard dan Duitse rivalen als BMW (47 miljard euro) en Mercedes-Benz (56 miljard euro). Met de opbrengst wil Volkswagen onder meer extra investeren in elektrisch rijden. Het is de grootste beursgang in Europa sinds 2011.\n\n\nIn Amsterdam noteert uitzender Randstad ex-dividend, wat betekent dat het aandeel geen recht meer geeft over het dividend van de afgelopen periode. Randstad verloor 8,4 procent en was daarmee de grootste daler in de AEX.\n\n\nIn Stockholm zakte kledingketen H&M 3,3 procent. Het Zweedse bedrijf heeft financieel flink te lijden van de beslissing om Rusland te verlaten vanwege de oorlog in Oekraïne. De kosten die daarmee gemoeid waren drukten stevig op de winst in het derde kwartaal van het gebroken boekjaar.\n\n\nHet Britse winkelbedrijf Next ging 8,3 procent onderuit in Londen na een winstwaarschuwing. Next heeft last van de hoge inflatie omdat daardoor mensen meer de hand op de knip houden." ] embeddings = model.encode(sentences) similarities = model.similarity(embeddings, embeddings) print(similarities.shape) # [4, 4] - Notebooks
- Google Colab
- Kaggle
Embedding Model APA/embed-embeddinggemma-300m-g39-v1.0
Overview
The model APA/embed-embeddinggemma-300m-g39-v1.0 is a text embedding model finetuned by
APA – Austria Presse Agentur. The model produces embeddings that represent the semantics of the
inputs and can be used in applications like semantic search.
It is based on a state-of-the-art open-weights embedding model (see section Base Model). APA finetuned the base model using various methods and a corpus of news texts provided by G39 members.
Embeddings produced by the model are vectors of 768 dimensions of floating-point numbers. The model was trained using Matryoshka Representation Learning (MRL) with dimensions 512, 256, and 128. Embeddings can be truncated to either number of dimensions with only a small loss of quality.
Finetuning primarily targeted the use case of asymmetric search (using a query to search for relevant documents in a large corpus). However, the model is also suitable for symmetric search (using an example document to search for similar documents).
Usage
The model is compatible with the SentenceTransformers framework. It can also be run using the vLLM or HuggingFace Text Embeddings Inference servers.
Texts passed to the model have to be prefixed depending on their usage:
- When embedding a search query, add the prefix
task: search result | query:(including a space character after the colon). - When embedding a document, add the prefix
title: none | text:(including a space character after the colon). Using the actual document's title instead ofnoneis supported by the base model, but was not used in finetuning and also wasn't tested by APA.
The model can process text lengths of up to 2048 tokens (including the prefix). Longer texts have to be split up into appropriate chunks. To count tokens, an AutoTokenizer from the HuggingFace Transformers framework can be used.
The model was trained using the bfloat16 data type. bfloat16 is also the preferred data type for running the model
and is therefore specified as dtype in the model's config.json.
If the used inference framework or hardware do not support bfloat16, float32 can be used instead. float16
cannot be used for running the model.
A minimal example for using the model in Python is below. Replace <model path> with the path to the model directory.
from transformers import AutoTokenizer
from sentence_transformers import SentenceTransformer
from enum import Enum
MODEL_PATH = "<model path>"
class TextType(Enum):
QUERY = 0
DOCUMENT = 1
def embed(text: str, text_type: TextType):
match text_type:
case TextType.QUERY:
text = "task: search result | query: " + text
case TextType.DOCUMENT:
text = "title: none | text: " + text
tokenizer = AutoTokenizer.from_pretrained(MODEL_PATH)
tokens = tokenizer.tokenize(text)
if len(tokens) > 2048:
raise ValueError("text is too long")
model = SentenceTransformer(MODEL_PATH)
embedding = model.encode(text, normalize_embeddings=True)
return embedding
print(embed("This is an example query", TextType.QUERY))
Base Model
The APA/embed-embeddinggemma-300m-g39-v1.0 model is a finetuned version of the google/embeddinggemma-300m model.
The base model was published under the Gemma Terms of Use, see https://ai.google.dev/gemma/terms.
It was introduced with the following technical report:
@article{embedding_gemma_2025,
title={EmbeddingGemma: Powerful and Lightweight Text Representations},
author={Schechter Vera, Henrique* and Dua, Sahil* and Zhang, Biao and Salz, Daniel and Mullins, Ryan and Raghuram Panyam, Sindhu and Smoot, Sara and Naim, Iftekhar and Zou, Joe and Chen, Feiyang and Cer, Daniel and Lisak, Alice and Choi, Min and Gonzalez, Lucas and Sanseviero, Omar and Cameron, Glenn and Ballantyne, Ian and Black, Kat and Chen, Kaifeng and Wang, Weiyi and Li, Zhe and Martins, Gus and Lee, Jinhyuk and Sherwood, Mark and Ji, Juyeong and Wu, Renjie and Zheng, Jingxiao and Singh, Jyotinder and Sharma, Abheesht and Sreepat, Divya and Jain, Aashi and Elarabawy, Adham and Co, AJ and Doumanoglou, Andreas and Samari, Babak and Hora, Ben and Potetz, Brian and Kim, Dahun and Alfonseca, Enrique and Moiseev, Fedor and Han, Feng and Palma Gomez, Frank and Hernández Ábrego, Gustavo and Zhang, Hesen and Hui, Hui and Han, Jay and Gill, Karan and Chen, Ke and Chen, Koert and Shanbhogue, Madhuri and Boratko, Michael and Suganthan, Paul and Duddu, Sai Meher Karthik and Mariserla, Sandeep and Ariafar, Setareh and Zhang, Shanfeng and Zhang, Shijie and Baumgartner, Simon and Goenka, Sonam and Qiu, Steve and Dabral, Tanmaya and Walker, Trevor and Rao, Vikram and Khawaja, Waleed and Zhou, Wenlei and Ren, Xiaoqi and Xia, Ye and Chen, Yichang and Chen, Yi-Ting and Dong, Zhe and Ding, Zhongli and Visin, Francesco and Liu, Gaël and Zhang, Jiageng and Kenealy, Kathleen and Casbon, Michelle and Kumar, Ravin and Mesnard, Thomas and Gleicher, Zach and Brick, Cormac and Lacombe, Olivier and Roberts, Adam and Sung, Yunhsuan and Hoffmann, Raphael and Warkentin, Tris and Joulin, Armand and Duerig, Tom and Seyedhosseini, Mojtaba},
publisher={Google DeepMind},
year={2025},
url={https://arxiv.org/abs/2509.20354}
}
- Downloads last month
- 24
Model tree for amauczka/APA-embed-embeddinggemma-300m-g39-v1.0
Base model
google/embeddinggemma-300mPaper for amauczka/APA-embed-embeddinggemma-300m-g39-v1.0
Evaluation results
- Cosine Accuracy@1 on Unknownself-reported0.879
- Cosine Precision@1 on Unknownself-reported0.879
- Cosine Recall@1 on Unknownself-reported0.879
- Cosine Ndcg@10 on Unknownself-reported0.941
- Cosine Mrr@10 on Unknownself-reported0.923
- Cosine Map@10 on Unknownself-reported0.923